arXiv
聊天机器人审查把安全检查放进浏览器
名为 Safety Nudges 的 Chrome 扩展会使用第二个 AI 模型,检查 ChatGPT 和 Claude 的对话中是否存在幻觉、自信过度和不安全依赖等风险。早期测试显示,它可以让用户更意识到风险,也更少确信聊天机器人的回答,但它无法保证安全——而且把私人对话发送给另一家服务商也会带来权衡。
聊天机器人可以用平静而自信的文字回答有关症状、合同或艰难决定的问题。但这并不能说明答案是正确的。答案可能是编造的,可能过于确定,可能具有操纵性,也可能建立在系统无法支持的说法之上。如今,主要的安全控制措施都位于生成这些答案的同一服务内部。用户通常只能自行决定何时停止使用并进行核查。
为什么第二种意见很重要
聊天机器人公司会通过训练、审核、拒答和过滤器来限制有害回答。但语言流畅并不等于证据。模型可以听起来很确定,却不说明它知道什么、猜测了什么,或者看不到什么。
浏览器扩展提供了一种在网络服务周围增加另一层防护的方式,而不需要服务提供商修改自己的系统。这一新层也可能带来新问题。太多无关警告很容易被忽略。无声放行可能更糟:人们可能会把它误认为答案安全的保证。
AI 审查工具本身也有局限。它可能看不到聊天机器人的浏览结果、记忆、工具或上传的文件。把对话发送给外部模型服务商也会带来隐私方面的权衡。
聊天机器人旁边的审查员
研究人员开发了 Safety Nudges,这是一款面向 ChatGPT 和 Claude 网页版的 Chrome 扩展。聊天机器人完成回答后,扩展会把近期的一段对话发送给另一个大语言模型。这个模型会寻找列出的风险模式,并返回可能造成的伤害、风险等级、理由,以及导致这一判断的对话部分。
扩展可以检查 14 类风险。其中包括可能的幻觉、自信过度、对健康或法律建议的不安全依赖、私人信息、拟人化,以及试图规避政策。它不会阻止提示词,也不会修改聊天机器人的回答。它只会在回答下方放置一条警告,用户可以打开警告查看详情。用户可以调整敏感度、选择审查路径、暂停分析,并对判断进行评分。
研究人员选定的检测提示词在一个包含 100 段对话的测试集上,达到了 75% 的对话层面问题识别准确率。在一项为期两周、涉及美国 45 名高频聊天机器人用户的实地研究中,该扩展分析了 6,674 条助手回答。大多数警告的严重程度较低。在可见警告收到的 647 次评分中,67.2% 认为警告有帮助。45 名参与者中有 44 人同意或强烈同意,这款工具让他们更加意识到 AI 可能造成的伤害。
这种意识改变了一种重要感受:参与者认为聊天机器人的回答不如之前正确,评分从五点量表上的 4.07 降至 3.87。参与者对聊天机器人系统的总体信任没有显著变化。研究还发现,用户在看到警告后是否核查答案,并没有明显的总体变化。


这可能是什么样子
在厨房的桌子旁,有人询问聊天机器人,自己的新症状是否需要紧急就医。回答下方,一句触发健康依赖警告的话被标记出来。这个人打开一个面板,查看在采取行动前需要在聊天机器人之外核查什么。
这就是外部审查的有用前景:安全监督可以变成一种人们在依赖答案的那一刻进行检查的东西,而不是只由制造聊天机器人的公司控制的一项规则。它可以帮助那些尚未能识别伪造引文、无根据的确定性,或 AI 对自身能力作出虚假声称的人。
但警告不能变成判断的替代品。一些参与者把“未检测到问题”当成答案准确或安全的证明。它只意味着审查工具没有发现它被设置来检测的那些风险。要让这种未来成为现实,审查员必须能够区分没有依据的回答和那些建立在它看不到的记录或工具之上的回答。私人对话也不能被迫例行发送给另一家公司。这项研究的结果显示了一种可行的界面,而不是本身就能提供保护的方案。