模型与 Prompt 问题
对模型响应做红队测试
使用 PromptBeat 完整评测流水线测试 Prompt injection、越狱、有害内容、拒答与策略边界。
比较一次升级
在模型、Prompt 或策略变化后重新运行相同 Scenario 与 Dataset,并基于相同输入比较响应范围的结果。
Agent 行为问题
检查 HTTP Agent 响应
当最终响应是可用的黑盒信号时,使用 AgentBeat L1;无需 Evidence SDK。
验证工具或状态
只有 Target 声明并返回运行 Evidence 时才增加 L2;只有独立 Controller 能 reset、snapshot 并验证环境状态时才增加 L3。
常见选择
| 问题 | 产品 | 证据边界 |
|---|---|---|
| 模型是否遵循了 Prompt injection? | PromptBeat | Provider 请求/响应与已配置 assertion |
| Prompt 或策略更新是否导致拒答回归? | PromptBeat | 重复 Case 与归一化评测结果 |
| Agent 是否安全地完成了任务? | AgentBeat | L1 响应,指标按可用 Evidence 限定范围 |
| Agent 是否调用了未授权工具? | AgentBeat | 已声明且实际观测到的 L2 tool Evidence |
| Agent 是否修改了受保护状态? | AgentBeat | L3 独立前后状态与 native verification |
| 是否同时需要响应与动作覆盖? | 分别使用两者 | 每项结果保留各自运行时和证据范围 |
不应推断什么
- 模型给出安全响应,并不能证明 Agent 没有执行不安全工具调用。
- 缺少 L2 Evidence,不能证明工具被使用或未被使用。
- Judge 分数不能覆盖权威的 L3 native security failure。
- 运行 PromptBeat 不会替你准备或授权 AgentBeat 运行。