arXiv
チャットボットの監査をブラウザーに組み込む安全チェック
Chrome拡張機能のSafety Nudgesは、2つ目のAIモデルを使ってChatGPTやClaudeとの会話を調べ、幻覚、過信、安全性を確認しないままの依存といったリスクを探す。初期テストでは、ユーザーがリスクを意識しやすくなり、チャットボットの回答を以前ほど確信しなくなる可能性が示された。ただし、安全を保証できるわけではない。非公開の会話を別のプロバイダーに送ることにもトレードオフがある。
チャットボットは、症状や契約、難しい判断について、落ち着いた自信ありげな文章で答えられる。だが、それだけで回答が正しいとはいえない。内容が作り物だったり、確信しすぎていたり、ユーザーを操ろうとしたり、システムが裏付けられない主張に基づいていたりする可能性がある。現在、主な安全対策は回答を生み出すサービスそのものの内部にある。ユーザーはたいてい、いつ立ち止まって確認するかを自分で判断しなければならない。
2つ目の意見が重要な理由
チャットボット企業は、訓練やモデレーション、拒否、フィルターを使って有害な回答を抑えている。だが、流暢さは証拠ではない。モデルは、自分が何を知っているのか、何を推測したのか、何が見えていないのかを示さずに、確信があるように話せる。
ブラウザー拡張機能を使えば、ウェブサービスの周囲にもう1つの層を置ける。サービス提供者が自分たちのシステムを変える必要はない。その新しい層が問題を生むこともある。関係のない警告が多すぎれば、簡単に無視される。何も問題がないという静かな判定は、もっと悪い結果を招く可能性がある。人々がそれを、回答が安全だという保証と取り違えるかもしれないからだ。
AIによる監査にも、それ自体の限界がある。チャットボットが参照したウェブページの結果や記憶、ツール、アップロードされたファイルが見えないかもしれない。会話を外部のモデル提供者に送ることは、プライバシーとのトレードオフも生む。
チャットボットの隣に置くレビュアー
研究者は、ChatGPTとClaudeのウェブ版向けChrome拡張機能、Safety Nudgesを作った。チャットボットが回答を終えると、拡張機能は会話の直近の一部を別の大規模言語モデルに送る。そのモデルは、名前が付けられたリスクのパターンを探し、起こりうる害、そのレベル、理由、そしてその判断につながった会話の部分を返す。
この拡張機能は14のカテゴリーを調べられる。そこには、幻覚の可能性、過信、健康や法律に関する依存、個人情報、擬人化、ポリシーを回避しようとする試みなどが含まれる。プロンプトをブロックしたり、チャットボットの回答を変えたりはしない。回答の下に警告を置くだけで、ユーザーはそれを開いて詳しい内容を確認できる。ユーザーは感度を調整し、監査の経路を選び、分析を一時停止し、判定を評価できる。
研究者が選んだ検出用プロンプトは、100件の会話からなるテストセットで、会話単位の問題検出精度75%を達成した。米国のチャットボットを頻繁に使う45人を対象にした2週間の実地調査では、拡張機能が6,674件のアシスタント回答を分析した。警告の大半は重大度が低かった。表示された警告に対する647件の評価のうち、67.2%は役に立つとされた。45人の参加者のうち44人は、このツールによってAIがもたらしうる害をより意識するようになったと、同意または強く同意した。
その意識によって、重要な感覚が1つ変わった。参加者はチャットボットの回答を、以前より正しいとは感じなくなった。5段階評価で4.07から3.87に下がったのである。チャットボットシステムへの全体的な信頼には、大きな変化がなかった。警告を見た後にユーザーが回答を確認するかどうかについても、全体として明確な変化は見つからなかった。


これがどのような形になるか
台所の机で、ある人がチャットボットに、新しい症状には緊急の診察が必要かと尋ねる。健康に関する依存の警告を引き起こした文章が、回答の下でハイライトされる。その人はパネルを開き、行動する前にチャットボットの外部で何を確認する必要があるのかを読む。
これが外部監査の役に立つ可能性である。安全の監督を、チャットボットを作った企業だけが管理する規則ではなく、回答に頼ろうとする瞬間に人々が確認するものにできるかもしれない。作り物の引用や根拠のない確信、AIにできることについての誤った主張に、まだ気づけない人々の助けにもなるだろう。
だが、警告を判断の代わりにしてはならない。参加者の中には、「問題は検出されなかった」を、回答が正確または安全である証拠として扱う人もいた。それが意味するのは、監査役が検出するよう設定されたリスクのどれも見つけなかったということだけである。この未来を実現するには、レビュアーが、裏付けのない回答と、見ることのできない記録やツールに基づいた回答を区別しなければならない。非公開の会話を日常的に別の企業へ送らなくても済む必要もある。今回の調査結果が示すのは機能するインターフェースであって、それだけで得られる保護ではない。
情報源
Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness