獨立指南認識 TypeSafe AI 的 Jev:獨立指南
開始使用

先看數字對應的是哪個問題

Jev 機率與信心程度有什麼區別

理解單個選項機率與 Choice 信心程度的差別,避免把它們當成實測準確率。

載入這個範本

來源查核日期 更新日期 內容版本 1

證據性質 原創虛構教學範例,未預填模型結果。

原創虛構教學範例,未預填模型結果。

可編輯的起點

載入這個範本
1 · 要檢查的資料
原始問題或請求: 在哪裡可以下載發票?下個月的公司名稱要怎麼修改? 準備傳送的回覆: 在「帳務 → 發票」中下載發票。若要修改後續發票的公司名稱,請在下次帳單日期前,到「帳務 → 詳細資訊」中更新「公司名稱」。
2 · 你想問的問題
回覆是否回應了請求中明確提出的所有事項?
什麼情況下算「是」?
每個明確的問題或請求都有回應,包括明確說明目前無法回答。
什麼情況下算「否」?
至少有一個明確的問題或請求未獲回應。

這些是模型判斷的機率,不是實測準確率或保證。「是/否」對應你寫的標準,選項機率只在你提供的選項內比較。

兩種不同的量

選項機率對應一個可能結果。TypeSafe 的 Choice 信心程度概括整組選項機率的分布形狀,不是最高機率的另一個名字。Noul 只有 Yes 機率,沒有單獨的 confidence 欄位。本站自訂編輯器展示模型機率,不是獨立測量的準確率。

不要把很高的 Yes 理解成「模型擅長這項任務」。它表示在這道問題和規則下傾向回答 Yes。檢查絕對承諾時,Yes 指向可能的問題;檢查涵蓋情況時,Yes 表示條件看起來已滿足。

用回覆練習理解數值

載入回覆完整性範本,閱讀規則,並先確定回覆應涵蓋哪些明確要求。只修改回覆中的一個部分,再比較建議。頁面不提供預期機率,數字變化本身也不能證明品質改善。

自訂編輯器沒有展示官方獨立的 Choice confidence 欄位,不應把其中一則機率長條重新稱為信心程度。

留意確定但錯誤的判斷

試一則提到所有主題、卻沒有回答問題的回覆,再檢查一則換了表達方式但回答清楚的回覆。集中的分布仍可能來自錯誤理解、問題設計不當或上下文不足。即使數值很確定,也要檢查失敗樣本。

用證據選擇門檻

自動執行前,收集有代表性的例子,在不參考模型結果的情況下獨立標註。分別記錄錯誤放行和不必要轉人工,再根據兩類錯誤的代價選擇門檻,並在未參與規則調整的樣本上驗證。本教學不推薦通用門檻。

繼續體驗回覆完整性方案。網站功能檢查和個別即時結果不能證明校準水平或整體準確率。

來源與延伸閱讀

本指南以官方文件及附有連結的社群回報為依據。社群觀察均註明原作者。

  1. TypeSafe: Confidence
  2. TypeSafe: Noul
我們如何查核來源