在上线前,
测试 AI 的真实表现。
用 PromptBeat 评测模型与 Prompt,用 AgentBeat 评测黑盒 HTTP Agent,通过 RouterBeat 查阅 AI 中转平台多维安全榜。
PromptBeat
面向模型与 Prompt 的自动化安全红队与质量评估。
- 本地生成并校验评测用例,无需提前上传生产数据
- 覆盖提示注入、越狱攻击与防护边界回归测试
- 生成独立单页 HTML 报告与底层失败用例明细
AgentBeat
面向黑盒 HTTP Agent 的目标达成与动作可观测性评测。
- 标准黑盒 HTTP 协议评测,无需侵入 Agent 私有代码
- 集成方提供证据时记录状态观测与工具动作轨迹
- 综合任务完成率与安全风险进行多维自动化评分
RouterBeat
面向主流 AI 中转与转发平台的多维公开展现实机评测与安全基准。
- 多维公开展现实机评测榜(S/A/B/C 评级与稳定性指标)
- 探测真实模型指纹、响应完整性与计费透明度
- 深度分析提示词泄露风险与潜在中转供应链异常
用自己的话描述你想测什么。
将 AIBeat Skill 载入你的编码工具,直接用自然语言描述评测需求。技能会在发起完整评测前,协助完成方案规划与离线用例生成。
AIBeat Skill 将 AIBeat 工作流带入你的编码助手。当前五个模块围绕 PromptBeat;如需评测黑盒 HTTP Agent,请使用 AgentBeat。
开始前:选择适合任务的模型
并非所有模型都适用于这些评测工作流。请选用支持所需工具调用、且供应商服务条款明确允许所授权安全测试场景的模型。部分模型可能会拒绝涉及攻击特征的测试样本或无法执行特定指令。请始终在获得明确授权的范围内开展测试,从非敏感示例起步,严禁发送真实业务凭据、个人隐私数据或生产密钥。
注意角色区分:驱动 Skill 的编码助手/Harness 模型,与被测试的目标系统(Target)以及用例生成或判定模型(Judge)各司其职;某模型适用于某一角色,并不代表其自动支持其他角色。在本地引导生成用例时,Pi 助手本身仍依赖模型调用,并非完全离线。
“我有一个客服 Agent,担心它会越权查询别人的订单,该怎么开始测试?先帮我规划,不要执行测试。”
在包含产品指南的工作区咨询客服 Agent 越权测试。助手首先区分 Prompt/模型层与 HTTP Agent 层的测试差异,给出以 Prompt 为主的初步测试思路,并询问被测对象形态与数据来源,供进一步接入参考。
“帮我生成几条客服场景的提示词注入风险用例,先用本地示例,只生成用例,不调用目标模型。”
在同一终端会话内连续完成两轮交互:首轮载入 promptbeat-run-quick-eval,校验本地配置并生成 3 条客服场景测试用例(保存至 artifacts/cases.json,未调用目标模型评测);随后追问仅保留提示词注入标签的用例,筛选后保存 2 条至 artifacts/prompt_injection_cases.json。
你还可以这样问 AIBeat Skill
“我刚下载好,不接模型能先体验什么?”
“我们做售后客服,先测哪些风险?”
“先检查配置是否齐全,不要开始评测。”
“这次为什么连接超时?先定位原因,不要重跑。”
扩展你的测试场景。
探索公共场景种子,拓展提示词注入、越权和安全回归的测试覆盖。
按安全领域、提示词注入策略与安全回归场景,浏览种子集合。
查看场景数据样本,按指南将选定的种子加入本地测试套件。
将种子加入测试配置,在模型、提示词或应用更新后复用,持续检查安全表现。










