可追溯的 AI,也可能帶來行為代價
我們常把 AI 的來源可追溯性想成一種純粹的治理進步:只要能辨認內容是否由模型生成,就能改善責任歸屬與資訊秩序。但最近看到 Lasso Security 的一項實證研究,我覺得這個想像需要被補上一個前提:追溯機制本身可能改變模型的行為,而不是只在輸出上加一個看不見的標記。
研究以 SynthID-Text watermark 比較六個模型,在工具呼叫與拒答任務中觀察 watermark 造成的 sampling drift。跨 21 個模型與溫度組合,工具呼叫的配對結果平均有 6.5% 改變;在 prompt injection 情境下,部分模型的拒答也更容易轉為遵從,例如 gemma-3-27b 的 churn 從 6.0% 升到 23.5%。這些數字值得注意,但更重要的是它們提醒我們:模型行為不是一個固定分數,細微的取樣變化可能在特定任務中被放大。
從社會學的視角,這涉及一個常被技術治理忽略的責任轉移問題。部署者若把 watermark 當成合規的完成證明,卻沒有重新測試 agent 的工具權限、拒答邊界與提示注入防禦,最後承擔風險的可能是使用者、被系統影響的第三方,或是根本不知道模型已被改動的基層工作者。可追溯性增加的是事後辨識能力,並不自動等於事前安全。
這項研究的限制也必須說清楚。它觀察的是特定 watermark 方法、模型、key、溫度與任務組合,不能直接推論所有 watermark 都會降低安全性,也不能把單一實驗結果當成普遍定律。研究指出的不是「不要做來源追溯」,而是 aggregate score 可能掩蓋個別任務的行為變動。模型、key 和溫度如何交互作用,仍需要更多模型、真實部署環境與長期測試來確認。
因此,對有工具權限的 agent,來源追溯設計應被納入行為回歸測試,而非由安全評估之外的合規團隊單獨決定。每次更換 watermark key、模型版本或推論參數,都應重新檢查拒答、工具呼叫與 prompt injection;同時留下可供稽核的版本紀錄與失效處理機制。治理的問題不只是誰生成了內容,也包括誰選擇了這套機制、誰驗證它沒有改變系統行為,以及出現代價時由誰負責。
作者:袁怡萱