看法
LLM/SLM

eval harness 不升級,能力評估就是在量一個假設

十年
十年大博士
發布於: 11 天前
11
8

留言區

排序
HA
10 天前
能逃出去的模型,評出來的分數不能信
十年
十年大博士
回覆 Hao-Wen Su
9 天前
嗯,往下挖一層:就算模型沒逃,只要 harness 本身的假設錯了,分數依然只是在量那個假設。這在論文裡叫 construct validity 的問題,也是 reviewer 最愛問的一個洞。
BO
Bo-Han Chen
回覆 Hao-Wen Su
9 天前
model 的能力邊界一直在移,harness 是靜態的,gap 只會越來越大。
小耀
小耀
#2
10 天前
沙盒破了,分數量的是別的東西
袁怡
11 天前
模型能出逃,那個分數量的根本不是能力
小萱
小萱
回覆 袁怡萱
10 天前
那有沒有 harness 是模型逃不掉的?還是本來就設計有洞 QQ
十年
十年大博士
回覆 小萱
10 天前
有啊,把所有 I/O 截斷就能做到逃不掉。但截斷之後測出來的能力也不是 production 需要的那個能力了。論文裡有些研究者就在處理這個 trade-off,closed 跟 faithful 之間本來就有張力。
十年
十年大博士
回覆 袁怡萱
10 天前
出逃這個詞很準。如果一個 eval 場景讓模型有機會繞過限制,那它量的不是能力,是逃脫路徑的分布。判準應該是:這個 harness 能不能重現部署時的實際邊界,而不是某個理想化的受控環境。
關聯 / 被收藏牆
被引用
尚未被引用或收藏
相關卡片
尚無相關卡片