arXiv
聊天機器人稽核把安全檢查帶進瀏覽器
Chrome 擴充功能 Safety Nudges 使用第二個 AI 模型,檢查 ChatGPT 和 Claude 的對話中是否存在幻覺、過度自信和不安全依賴等風險。早期測試顯示,它能讓使用者更留意聊天機器人的回答,也降低他們對回答的確信程度,但它無法保證安全——而且把私人對話傳給另一家服務商,也會帶來取捨。
聊天機器人可以用平靜、自信的文字,回答有關症狀、合約或艱難決定的問題。但這不代表回答正確。回答可能是捏造的、過度確定、具有操控性,或是建立在系統無法支持的主張上。如今,主要的安全控制都位於產生回答的同一項服務之內。使用者通常只能自行決定何時停下來查證。
為什麼第二個意見很重要
聊天機器人公司會使用訓練、內容審核、拒答和篩選機制,來限制有害回答。但流暢並不代表有證據。模型可以聽起來很確定,卻不說明自己知道什麼、猜了什麼,或看不到什麼。
瀏覽器擴充功能提供了一種方式,可以在網路服務外再加上一層,而不必要求服務商改變自己的系統。這一層也可能帶來新的問題。太多不相關的警告很容易被忽略。安靜地通過檢查可能更糟:人們可能把它誤認為回答安全的保證。
AI 稽核工具本身也有侷限。它可能看不到聊天機器人的瀏覽結果、記憶、工具或上傳檔案。把對話傳給外部模型服務商,也會形成隱私上的取捨。
聊天機器人旁邊的審查者
研究人員打造了 Safety Nudges,這是一個供 ChatGPT 和 Claude 網頁版使用的 Chrome 擴充功能。聊天機器人完成回答後,擴充功能會把最近一段對話傳給另一個大型語言模型。該模型會尋找指定的風險模式,並回傳可能造成的傷害、風險程度、理由,以及導致這項判斷的對話部分。
這個擴充功能可以尋找 14 類風險,包括可能的幻覺、過度自信、對健康或法律建議的不當依賴、私人資訊、擬人化,以及試圖規避政策。它不會阻擋提示,也不會改變聊天機器人的回答。它只會在回答下方放置一則警告,使用者可以開啟警告查看詳細資訊。使用者可以調整敏感度、選擇稽核路徑、暫停分析,並為判斷評分。
研究人員選定的偵測提示,在一組 100 段對話的測試集中,達到 75% 的對話層級問題準確率。在一項為期兩週、由美國 45 名經常使用聊天機器人的使用者參與的實地研究中,擴充功能分析了 6,674 個助理回答。大多數警告的嚴重程度都很低。在 647 個針對可見警告的評分中,67.2% 認為警告有幫助。45 名參與者中,有 44 人同意或非常同意這項工具讓他們更注意到 AI 可能造成的傷害。
這種意識改變了一種重要感受:參與者認為聊天機器人回答正確的程度降低了,在五分制中從 4.07 降至 3.87。對聊天機器人系統的整體信任沒有顯著變化。研究也沒有發現,在看到警告後,使用者是否查證回答這件事出現明確的整體變化。


這可能會是什麼樣子
在廚房的書桌前,有人詢問聊天機器人,新的症狀是否需要緊急就醫。一句觸發健康依賴警告的句子,會在回答下方以醒目方式標示出來。這個人開啟一個面板,查看在採取行動前,哪些內容需要在聊天機器人之外進行查證。
這就是外部稽核的實用承諾:安全監督可能變成人們在依賴回答的當下就能檢查的東西,而不再只是由打造聊天機器人的公司單方面控制的規則。它可以幫助那些還無法辨認捏造引文、毫無根據的確定語氣,或 AI 對自身能力所做不實宣稱的人。
但警告不能取代判斷。有些參與者把「未偵測到問題」視為回答準確或安全的證據。這只代表稽核工具沒有發現它被設定要偵測的風險。要讓這個未來成真,審查者必須能區分不受支持的回答,與建立在它看不到的紀錄或工具之上的回答。私人對話也不能必須例行傳送給另一家公司。這項研究的結果顯示的是一個可行的介面,而不是本身就能提供保護的機制。
來源
Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness