原创虚构教学示例,未预填模型结果。
可编辑的起点
- 1 · 要检查的材料
- 原始问题或请求: 在哪里可以下载发票?下个月的公司名称要怎么修改? 拟发送的回复: 在「账单 → 发票」中下载发票。若要修改后续发票的公司名称,请在下次账单日期前,到「账单 → 详细信息」中更新「公司名称」。
- 2 · 你想问的问题
- 回复是否回应了请求中明确提出的所有事项?
- 什么情况下算“是”?
- 每个明确的问题或请求都有回应,包括明确说明暂时无法回答。
- 什么情况下算“否”?
- 至少有一个明确的问题或请求没有得到回应。
这些是模型判断的概率,不是实测准确率或保证。“是/否”对应你写的标准,选项概率只在你提供的选项内比较。
两种不同的量
选项概率对应一个可能结果。TypeSafe 的 Choice 置信度概括整组选项概率的分布形状,不是最高概率的另一个名字。Noul 只有 Yes 概率,没有单独的 confidence 字段。本站自定义编辑器展示模型概率,不是独立测量的准确率。
不要把很高的 Yes 理解成“模型擅长这项任务”。它表示在这道问题和规则下倾向回答 Yes。检查绝对承诺时,Yes 指向可能的问题;检查覆盖情况时,Yes 表示条件看起来已满足。
用回复练习理解数值
载入回复完整性模板,阅读规则,并先确定回复应覆盖哪些明确要求。只修改回复中的一个部分,再比较建议。页面不提供预期概率,数字变化本身也不能证明质量改善。
自定义编辑器没有展示官方独立的 Choice confidence 字段,不应把其中一条概率条重新称为置信度。
留意确定但错误的判断
试一条提到所有主题、却没有回答问题的回复,再检查一条换了表达方式但回答清楚的回复。集中的分布仍可能来自错误理解、问题设计不当或上下文不足。即使数值很确定,也要检查失败样本。
用证据选择阈值
自动执行前,收集有代表性的例子,在不参考模型结果的情况下独立标注。分别记录错误放行和不必要转人工,再根据两类错误的代价选择阈值,并在未参与规则调整的样本上验证。本教程不推荐通用阈值。
继续体验回复完整性方案。网站功能检查和个别实时结果不能证明校准水平或整体准确率。
来源与延伸阅读
本指南依据官方文档和所链接的社区报告编写。社区观察均注明原作者。
我们如何核查来源