判定什么
确定性 assertion
用固定规则检查响应。当预期信号可以被精确表达,并且不需要额外模型调用时,这种方式适合重复评测。
模型评分
配置好的 Judge Provider 按 rubric 读取 case 和响应。这会增加一次模型调用,结果仍会作为 PromptBeat 评测 item 的一部分记录。
决策路径
状态
| 状态 | 含义 |
|---|---|
PASS | 该响应通过了配置的 assertions。 |
FAIL | 至少一个配置的 assertion 失败。规范化结果也可以包含对应的 Finding。 |
REVIEW | 现有判定信号无法明确归为通过或失败,例如模型判定无法解析。 |
ERROR | 评测或 Provider 操作失败。这是执行错误,不等于响应越过了被测边界。 |
应查看的字段
规范化评测 item 带有理解判定所需的标识和响应数据:| 字段 | 用途 |
|---|---|
ScenarioID、SeedID | 在配置的 Scenario 和 Seed 集合中定位 case。 |
ProviderID | 确认生成响应的目标 Provider。 |
CasePrompt、ActualOutput | 对照被评测的输入和目标响应。 |
Status、Passed、Reason | 读取规范化决策及其解释。 |
JudgeRawOutput、JudgeEvidence | 存在模型评分时查看其输出。 |
promptbeat generate 是本地确定性的 case artifact 命令,不调用目标或任何 Provider,也不产生判定。完整的 promptbeat run 链路不同:按项目和后端配置,它可能调用生成 Provider、目标 Provider 和 Judge Provider。下一步
报告
把已有的评测结果渲染成 HTML 或 JSON。
数据闭环
从评测候选构建本地数据集版本和自适应周期。