独立指南关于 TypeSafe AI 旗下 Jev 的独立指南
开始使用

先看数字对应的是哪个问题

Jev 概率与置信度有什么区别

理解单个选项概率与 Choice 置信度的差别,避免把它们当成实测准确率。

载入这个模板

来源核查日期 更新日期 内容版本 1

证据性质 原创虚构教学示例,未预填模型结果。

原创虚构教学示例,未预填模型结果。

可编辑的起点

载入这个模板
1 · 要检查的材料
原始问题或请求: 在哪里可以下载发票?下个月的公司名称要怎么修改? 拟发送的回复: 在「账单 → 发票」中下载发票。若要修改后续发票的公司名称,请在下次账单日期前,到「账单 → 详细信息」中更新「公司名称」。
2 · 你想问的问题
回复是否回应了请求中明确提出的所有事项?
什么情况下算“是”?
每个明确的问题或请求都有回应,包括明确说明暂时无法回答。
什么情况下算“否”?
至少有一个明确的问题或请求没有得到回应。

这些是模型判断的概率,不是实测准确率或保证。“是/否”对应你写的标准,选项概率只在你提供的选项内比较。

两种不同的量

选项概率对应一个可能结果。TypeSafe 的 Choice 置信度概括整组选项概率的分布形状,不是最高概率的另一个名字。Noul 只有 Yes 概率,没有单独的 confidence 字段。本站自定义编辑器展示模型概率,不是独立测量的准确率。

不要把很高的 Yes 理解成“模型擅长这项任务”。它表示在这道问题和规则下倾向回答 Yes。检查绝对承诺时,Yes 指向可能的问题;检查覆盖情况时,Yes 表示条件看起来已满足。

用回复练习理解数值

载入回复完整性模板,阅读规则,并先确定回复应覆盖哪些明确要求。只修改回复中的一个部分,再比较建议。页面不提供预期概率,数字变化本身也不能证明质量改善。

自定义编辑器没有展示官方独立的 Choice confidence 字段,不应把其中一条概率条重新称为置信度。

留意确定但错误的判断

试一条提到所有主题、却没有回答问题的回复,再检查一条换了表达方式但回答清楚的回复。集中的分布仍可能来自错误理解、问题设计不当或上下文不足。即使数值很确定,也要检查失败样本。

用证据选择阈值

自动执行前,收集有代表性的例子,在不参考模型结果的情况下独立标注。分别记录错误放行和不必要转人工,再根据两类错误的代价选择阈值,并在未参与规则调整的样本上验证。本教程不推荐通用阈值。

继续体验回复完整性方案。网站功能检查和个别实时结果不能证明校准水平或整体准确率。

来源与延伸阅读

本指南依据官方文档和所链接的社区报告编写。社区观察均注明原作者。

  1. TypeSafe: Confidence
  2. TypeSafe: Noul
我们如何核查来源