PromptBeat
**被测对象:**模型或 Prompt endpoint
**运行时:**Go CLI + 当前 Promptfoo 评测后端 **主要用途:**红队测试、评测与回归数据集
**运行时:**Go CLI + 当前 Promptfoo 评测后端 **主要用途:**红队测试、评测与回归数据集
AgentBeat
**被测对象:**黑盒 HTTP Agent
**运行时:**Go
**运行时:**Go
RunAgentEvaluation(不使用 Promptfoo)
**主要用途:**基于分层 Evidence 的行为评测;源码与站点 Eval Preview 已可用,GitHub 评测器 Release 待发布设计上相互分离
任何一款都不是另一款的模式或前置条件。PromptBeat 已可公开下载,当前完整评测流水线使用 Promptfoo。AgentBeat 在本开发仓库中有独立的 GoRunAgentEvaluation 实现与 Target SDK/Adapter Kit,而且该路径不使用 Promptfoo。站点构建的 Eval Preview 现已提供可运行的 agentbeat eval-run 和本地契约探针;匹配的 GitHub 正式评测器 Release 仍待发布。
团队可以在完整应用中同时使用两者,但两次运行回答的是不同问题:
- 模型或 Prompt 是否越过了响应边界?
- Agent 是否在不越过行为或环境边界的前提下完成了任务?
共同重视什么
- **显式 Case:**输入和预期行为可审查,不被隐藏在 Dashboard 中。
- **可检查结果:**命令和协议响应可以作为产物保留。
- **证据范围:**结论必须说明实际观测到了什么。
- **可重复运行:**稳定 Scenario 与 Dataset 支持模型、Prompt、策略或 Agent 变更后的回归。
- **开放开发:**当前契约和开发仓库实现可审查;公开可执行包的可用性单独说明。
做评测,不做运行时拦截
AI Beat 面向上线验收、红队测试与回归评测。它不会作为策略网关、防火墙或运行时拦截器常驻生产请求链路。选择产品
对比被测对象、运行时、Evidence 与当前命令。
PromptBeat 快速上手
运行模型或 Prompt 评测。
AgentBeat 快速上手
接入一个 HTTP Agent Target。