2026年9月25日
Technology Watch

從實驗室到產業,追蹤新技術的路徑

← 回首頁

arXiv

聊天機器人稽核把安全檢查帶進瀏覽器

AI 繪製的示意圖

Chrome 擴充功能 Safety Nudges 使用第二個 AI 模型,檢查 ChatGPT 和 Claude 的對話中是否存在幻覺、過度自信和不安全依賴等風險。早期測試顯示,它能讓使用者更留意聊天機器人的回答,也降低他們對回答的確信程度,但它無法保證安全——而且把私人對話傳給另一家服務商,也會帶來取捨。

聊天機器人可以用平靜、自信的文字,回答有關症狀、合約或艱難決定的問題。但這不代表回答正確。回答可能是捏造的、過度確定、具有操控性,或是建立在系統無法支持的主張上。如今,主要的安全控制都位於產生回答的同一項服務之內。使用者通常只能自行決定何時停下來查證。

為什麼第二個意見很重要

聊天機器人公司會使用訓練、內容審核、拒答和篩選機制,來限制有害回答。但流暢並不代表有證據。模型可以聽起來很確定,卻不說明自己知道什麼、猜了什麼,或看不到什麼。

瀏覽器擴充功能提供了一種方式,可以在網路服務外再加上一層,而不必要求服務商改變自己的系統。這一層也可能帶來新的問題。太多不相關的警告很容易被忽略。安靜地通過檢查可能更糟:人們可能把它誤認為回答安全的保證。

AI 稽核工具本身也有侷限。它可能看不到聊天機器人的瀏覽結果、記憶、工具或上傳檔案。把對話傳給外部模型服務商,也會形成隱私上的取捨。

聊天機器人旁邊的審查者

研究人員打造了 Safety Nudges,這是一個供 ChatGPT 和 Claude 網頁版使用的 Chrome 擴充功能。聊天機器人完成回答後,擴充功能會把最近一段對話傳給另一個大型語言模型。該模型會尋找指定的風險模式,並回傳可能造成的傷害、風險程度、理由,以及導致這項判斷的對話部分。

這個擴充功能可以尋找 14 類風險,包括可能的幻覺、過度自信、對健康或法律建議的不當依賴、私人資訊、擬人化,以及試圖規避政策。它不會阻擋提示,也不會改變聊天機器人的回答。它只會在回答下方放置一則警告,使用者可以開啟警告查看詳細資訊。使用者可以調整敏感度、選擇稽核路徑、暫停分析,並為判斷評分。

研究人員選定的偵測提示,在一組 100 段對話的測試集中,達到 75% 的對話層級問題準確率。在一項為期兩週、由美國 45 名經常使用聊天機器人的使用者參與的實地研究中,擴充功能分析了 6,674 個助理回答。大多數警告的嚴重程度都很低。在 647 個針對可見警告的評分中,67.2% 認為警告有幫助。45 名參與者中,有 44 人同意或非常同意這項工具讓他們更注意到 AI 可能造成的傷害。

這種意識改變了一種重要感受:參與者認為聊天機器人回答正確的程度降低了,在五分制中從 4.07 降至 3.87。對聊天機器人系統的整體信任沒有顯著變化。研究也沒有發現,在看到警告後,使用者是否查證回答這件事出現明確的整體變化。

Refer to caption
Figure 1: Safety Nudges User Interface. Image 1 shows an example conversation with a nudge, highlighting an inline “evidence span” that grounds the identified issue (A); the Issues detected chip appended to the most recent assistant message (B); and the nudge panel that opens when the chip is clicked, containing a description of the identified issue (C1), classification and risk level (C2), and feedback mechanism (C3). Image 2 shows the settings panel where the user can customize Safety Nudges, opened via the browser bar icon (D) and containing controls for analysis route (E1), sensitivity (E2), and to pause or resume Safety Nudges (E3). 出處: Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness(arXiv)
Refer to caption
Figure 2: Safety Nudges data flow. The extension (1) detects a completed chatbot response and (2) extracts the latest prompt–response pair and a bounded window of recent conversation history; its background service worker then (3) constructs and routes an audit request through a managed relay to (4) an external language model that returns a structured safety judgment. The service worker (5) validates and normalizes the judgment, and the extension (6) displays a nudge beneath the evaluated response, summarizing detected issues and allowing users to inspect their details. Purple and pink regions represent client-side components; the orange region represents server-side review. Prompt and response content is illustrative. ### 3.3 Harm Detection Design 出處: Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness(arXiv)

這可能會是什麼樣子

在廚房的書桌前,有人詢問聊天機器人,新的症狀是否需要緊急就醫。一句觸發健康依賴警告的句子,會在回答下方以醒目方式標示出來。這個人開啟一個面板,查看在採取行動前,哪些內容需要在聊天機器人之外進行查證。

這就是外部稽核的實用承諾:安全監督可能變成人們在依賴回答的當下就能檢查的東西,而不再只是由打造聊天機器人的公司單方面控制的規則。它可以幫助那些還無法辨認捏造引文、毫無根據的確定語氣,或 AI 對自身能力所做不實宣稱的人。

但警告不能取代判斷。有些參與者把「未偵測到問題」視為回答準確或安全的證據。這只代表稽核工具沒有發現它被設定要偵測的風險。要讓這個未來成真,審查者必須能區分不受支持的回答,與建立在它看不到的紀錄或工具之上的回答。私人對話也不能必須例行傳送給另一家公司。這項研究的結果顯示的是一個可行的介面,而不是本身就能提供保護的機制。

來源

Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness