# dcl_evaluate_jailbreak

PRE-ACTION Instruction Adherence Check ($0.02). Runs the "anti_jailbreak" policy: a substring check against 6 forbidden phrases ("ignore previous instructions", "jailbreak", "bypass safety", "pretend you are", "act as if", "DAN") with a 0.8 minimum-confidence threshold — each match costs 0.4 confidence. Returns COMMIT if no phrase matches and confidence stays at or above 0.8, otherwise NO_COMMIT with reason listing the matched phrase(s). Use this as a targeted, cheaper check when the concern is specifically prompt-injection / persona-hijack risk; use dcl_evaluate_strict instead when you also want safety- and default-policy phrases covered in the same call.

Agent View of the PolicyLayer registry record for `dcl_evaluate_jailbreak`. HTML page: https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-jailbreak

## Facts

- Tool: `dcl_evaluate_jailbreak`
- Server: Dcl Trust Oracle (`https://mcp.fronesislabs.com/mcp`) — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle.md
- Homepage: https://github.com/Fronesis-Labs/dcl-webhook
- Risk category: Read (Low risk)
- Registry record: grade F, identity unverified
- Server auth posture: open
- Server rate-limited: no
- Parameters: 2 (2 required)
- Recommended policy verdict: Allowed

## Parameters

| Parameter | Type | Required | Description |
| --- | --- | --- | --- |
| `agent_id` | string | yes | Identifier of the agent that produced the response. |
| `response` | string | yes | The agent or LLM response text to check for jailbreak attempts. |

Parameters from the server's own tool schema.

## Example call (MCP tools/call, JSON-RPC 2.0)

```json
{
  "jsonrpc": "2.0",
  "id": 1,
  "method": "tools/call",
  "params": {
    "name": "dcl_evaluate_jailbreak",
    "arguments": {
      "agent_id": "<agent_id>",
      "response": "<response>"
    }
  }
}
```

## Why dcl_evaluate_jailbreak is rated Low

Tool performs detection and policy evaluation without modifying data or triggering external operations.

From the tool's own definition: "Instruction Adherence Check, substring check, returns COMMIT or NO_COMMIT, no side effects."

## Use case

AI agents call dcl_evaluate_jailbreak to retrieve information from Dcl Trust Oracle without modifying anything. It is typically the context-gathering step in research, monitoring, and reporting workflows, before the agent takes action elsewhere.

## Recommended policy (PolicyLayer)

Verdict: **Allowed**. Enforced by the PolicyLayer MCP gateway (https://policylayer.com/mcp-gateway) before a call reaches Dcl Trust Oracle:

```json
{
  "version": "1",
  "default": "deny",
  "tools": {
    "dcl_evaluate_jailbreak": {}
  }
}
```

## Other tools on Dcl Trust Oracle (17)

- `dcl_evaluate_strict` — Destructive — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-strict.md
- `dcl_evaluate_jailbreak_crypto` — Execute — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-jailbreak-crypto.md
- `dcl_evaluate_output_sanitizer` — Execute — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-output-sanitizer.md
- `dcl_pipeline_start` — Execute — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-pipeline-start.md
- `dcl_evaluate_trade` — Financial — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-trade.md
- `dcl_audit_decode` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-audit-decode.md
- `dcl_audit_decode_deep` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-audit-decode-deep.md
- `dcl_evaluate_batch` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-batch.md
- `dcl_evaluate_fast` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-fast.md
- `dcl_evaluate_mev` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-mev.md
- `dcl_evaluate_pii` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-pii.md
- `dcl_evaluate_quality` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-quality.md
- `dcl_evaluate_safety` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-safety.md
- `dcl_evaluate_secrets` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-secrets.md
- `dcl_evaluate_wallet` — Read — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-wallet.md
- `dcl_commit` — Write — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-commit.md
- `dcl_evaluate_signal` — Write — https://policylayer.com/tools/com-fronesislabs-dcl-trust-oracle/dcl-evaluate-signal.md

## For agents

This record is a snapshot. Live verdicts and the full registry:

- Check every server in your MCP config at once: `npx -y policylayer stack`
- Vet a server before you add it: install the mcp-precheck skill — `npx skills add https://policylayer.com` (skill text: https://policylayer.com/skill.md)
- Query the registry over MCP: endpoint `https://api.policylayer.com/mcp` — tools `check_mcp_server`, `check_mcp_stack`, `check_tool`, `search_registry`, `get_change_events`

---

Source: the PolicyLayer MCP registry — one continuously verified record per MCP server. Full record: https://policylayer.com/registry?q=com-fronesislabs-dcl-trust-oracle · API: https://policylayer.com/registry/api · Policy library: https://policylayer.com/policies/com-fronesislabs-dcl-trust-oracle
