
排行榜讓複雜的選擇看起來簡單明了。找到最高分,選擇該模型,然後繼續。但當遇到第一個真正的任務,例如格式糟糕的文件、含糊不清的指令或緊迫的截止日期時,困難就回來了。我會從這裡開始比較:首先是需要完成的工作,以及對理想結果的清晰描述。
分數實際衡量的是什麼
基準測試是一組已定義的任務以及一種用於對回應進行評分的方法。它的價值在於使比較結果可重複。在這些任務上表現良好的模型表明,在這些條件下它具有一定的實用價值。下一個問題是,這些條件與您關心的條件有多大程度的相似。
史丹佛大學於 2022 年提出的 HELM 原始研究主張在不同的場景和多種指標下評估語言模型。準確率只是該方法的一部分;效率、穩健性和其他屬性也同樣重要。這項早期研究的價值在於其方法論,而不是作為當前產品的排名依據。
讓測試模擬普通的星期二
假設您需要協助將客戶訊息轉換為每週重複出現的問題清單。一般的知識測驗可能無法告訴您系統是否能保留投訴的含義、處理不清晰的語句或避免曲解客戶的意圖。您可以事先寫下預期類別,並使用少量非機密範例進行測試。
包含一個簡單的範例、一個比較複雜的範例以及一個正確答案是請求澄清的範例。確保每個模型的說明和可用資源相同。這雖然無法對所有可能的用途做出科學的判斷,但可以在您圍繞它建立工作流程之前發現不匹配之處。
計算修改答案所花費的時間
考慮進行一個包含十個簡短摘要的範例測試。系統 A 運作需要 10 分鐘,檢查和修復需要 20 分鐘。系統 B 運作需要 15 分鐘,審核需要 5 分鐘。如果兩者最終都能提供可接受的結果,那麼系統 A 的總工作時間為 30 分鐘,系統 B 的總工作時間為 20 分鐘。更快的首次回應並沒有帶來更快的最終結果。
這就是「每次有效結果的成本」背後的理念。成本可能包括訂閱費用、等待時間、檢查費用以及錯誤造成的後果。這些假設性的數字並非針對任何特定產品的實際衡量標準。它們旨在說明,為什麼公開評分上的微小差異可能遠不如實際流程中反覆出現的問題重要。
流暢的回答仍然需要證據
校準描述了系統表達的置信度與其正確性之間的匹配程度。對讀者而言,實際問題在於,當證據不足時,不確定性是否能夠被清楚地呈現出來。一個只提供一個沒有支撐的數字的答案,可能比一個能夠指出缺失輸入的答案更難使用。
NIST 的自願性人工智慧風險管理框架將評估置於更廣泛的問題框架內,即係統的使用方式以及由此產生的風險。我從中汲取了一個小小的經驗:預先決定哪些輸出需要獨立檢查,哪些資訊必須排除在工具之外,以及在什麼情況下你會停止使用該工具執行特定任務。
保留一份決策記錄
儲存模型版本、測試日期、操作說明以及一些代表性的結果。當產品或你的工作發生重大變化時,重新審視先前的選擇。保存的範例通常比幾個月前某個助手感覺更好的記憶更有參考價值。
我傾向於使用一份簡短的候選名單,並輔以透明的試用流程。排行榜可以幫助您找到候選方案。最終的選擇應該取決於該工具是否能夠可靠地幫助您完成實際工作。
回到自己真正要完成的工作
在相同條件下,比較具有代表性的任務上的模型,並將審查時間與反應速度一起考慮。
更高的基準測試分數是否意味著模型更適合我的工作?
這是關於基準測試的任務和條件的證據。在將其作為通用答案之前,請使用您自身工作流程中的代表性範例進行測試。
參與討論
留言經審核通過後顯示。歡迎提出與主題相關的不同意見。