2026年9月25日
Technology Watch

研究室から産業へ。新しい技術の道筋を追う

← トップへ

arXiv

教室向けチャットボットはトーンのテストに合格しても授業には失敗する

AI が描いたイメージ

教師が設定したチャットボットは、すぐに返答し、適切な口調で話すことができても、教えるよう設計された授業を実行できるとは限らない。中学校教員27人を対象にした研究では、4つの指標のうち目的との整合が最も弱かった。この結果は、生徒が教室向けAIを頼れるようになる前に、その教育上の振る舞いをテストし、修正する方法が必要な理由を示している。

教師は汎用チャットボットに生徒の支援を頼めるが、そのボットが学びのために粘り強く考える過程を保ち、授業の範囲内にとどまり、答えではなく手がかりを与えるかどうかを確実に判断することはできない。生徒にはヒントや質問が必要かもしれないのに、完成した答えを受け取ることもある。ボットが何を言い、生徒が何を学ぶかを確認する責任は、依然として教師にある。

チャットボットは適切に聞こえても、間違った教え方をする

大規模言語モデルは、ワークシートのように授業計画に同じ固定された方法で従うわけではない。受け取った指示と会話から、次に続く可能性が高い返答を生成する。指示は返答に影響を与えられるが、それを保証するものではない。

そのため、教室で「役に立つ」という言葉は曖昧になる。教師が生徒自身に問題を考え抜いてほしいと思っているなら、親しみやすく反応のよい返答でも、授業を台無しにすることがある。話題から外れないボットでも、答えを明かしてしまうことがある。教師が設定するエージェントは、1回限りのプロンプトを、あらかじめ定めた範囲内で働く教科チューターのような、繰り返し使える教室での役割に変えることを意図している。

この研究は、ボットの教育上の仕事と、その周辺にある実際的な条件も分けて考えている。学校はAIツールを使う前に、生徒のプライバシー、年齢に適したコンテンツ、端末、ネットワーク、地域での承認を検討しなければならない。ここで問われているのは、より狭いが重要な問題である。教師は、ボットが意図した教え方をしているかどうかを判断できるのか。

テストは心地よい口調だけを対象にしたものではない

研究者は2026年夏、教員向け研修ワークショップに参加した中学校教員27人を調査した。教員たちは、科学またはコンピュテーショナル・シンキングの活動向けにチャットボットを作成し、テストした。

作成ツールには、ボットの目的(Purpose)、ルール(Rules)、行動特性、つまりペルソナ(Persona)をそれぞれ記述する場所が用意されていた。教員は言語モデルを選ぶこともでき、必要に応じて、ボットが検索するための授業資料を追加できた。Purposeは主に学習目標と教科の焦点に使われた。Rulesは、教え方の振る舞い、制限、異なる学習者への調整に使われることが多かった。

研究者はその後、完成したボットを4つの別々の問いで評価した。ボットは返答したか。示された目的に役立ったか。ルールに従ったか。求められたペルソナに合っていたか。

この分け方は重要である。ボットはトーンのテストに合格しても、授業には失敗することがある。研究では、チャットボットの88.9%が応答性の基準に合格した。ペルソナとの整合では81.5%が合格した。しかし、目的との整合に合格したのは59.3%だけで、最も低い結果だった。ルールの順守も、ほかの指標を下回った。

教員たちは、モデルを変えると、直接答えを与えないという指示にボットが従うかどうかが変わることがあると話した。また、設定項目について、より明確なラベル、例、テンプレート、ガイダンスを求めた。意図を入力欄に書くことは、その意図を実現させることと必ずしも同じではなかった。

Conceptual diagram mapping Norman's Gulf of Execution and Gulf of Evaluation to teacher-facing AI authoring. A teacher pedagogical goal is shown at the top and a teacher-facing AI authoring system at the bottom. The left side represents the pedagogical Gulf of Execution, showing how teachers translate pedagogical goals into configuration choices such as Purpose, Rules, and Persona. The right side represents the pedagogical Gulf of Evaluation, showing how teachers interpret generated chatbot behavior and assess whether it reflects their original pedagogical goals.
Figure 5. Mapping Norman’s Gulfs of Execution and Evaluation to teacher-facing AI authoring. Adapted from Figure 2.1 in Norman ([Norman Donald, 2013](https://arxiv.org/html/#bib.bib56)). In our adaptation, the pedagogical Gulf of Execution captures the translation of a teacher’s pedagogical goal into chatbot configuration, while the pedagogical Gulf of Evaluation captures the interpretation of generated chatbot behavior relative to that original goal.Conceptual diagram mapping Norman's Gulf of Execution and Gulf of Evaluation to teacher-facing AI authoring. A teacher pedagogical goal is shown at the top and a teacher-facing AI authoring system at the bottom. The left side represents the pedagogical Gulf of Execution, showing how teachers translate pedagogical goals into configuration choices such as Purpose, Rules, and Persona. The right side represents the pedagogical Gulf of Evaluation, showing how teachers interpret generated chatbot behavior and assess whether it reflects their original pedagogical goals.In our study, the pedagogical Gulf of Execution captures the distance between a teacher’s intended pedagogical behavior and the configuration actions available for expressing it. Teachers had to translate instructional intentions into fields such as Purpose, Rules, and Persona, a process that was not always straightforward. The pedagogical Gulf of Evaluation captures the distance between generated behavior and the teacher’s ability to judge whether that behavior reflects the original pedagogical intention. This distinction is particularly important for generative AI, where a response may appear conversationally appropriate without fully realizing the intended instructional purpose. Together, these two gulfs show why configurable controls alone are insufficient: teacher-facing AI authoring must support both the expression of pedagogical intentions and the evaluation of whether those intentions are realized in system behavior. 出典: Will It Teach as Intended? How Teachers Configure Educational AI Chatbots(arXiv)

欠けている機能は証拠である

この研究の中心的な発見は、設定だけではチャットボットを教育ツールにできないということだ。教師には、自分の意図を表現するための支援が必要だが、ボットの返答が実際にその意図と一致しているかを判断するための支援も必要である。

これは、目標を設定することと、結果を確認することの間にある隔たりである。教師は「答えではなく質問で生徒を導く」と書くかもしれない。ボットは辛抱強く励ますように聞こえても、難しい場面では答えを与えてしまうことがある。その失敗を見つける方法がなければ、教師は会話を手作業で監視し続けなければならない。

作成システムが、返答が学習目標から外れている箇所を教師に示し、その目標を修正したり、守らせたりできるようにするなら、教室向けAIは汎用的な答えの機械ではなく、制御可能な教育用の足場になりうる。教師が得られるのは、答えの質やトーンだけではなく、教育上の目的と制約についての証拠になる。

中学校の理科の授業で、水の循環について説明できずに困っている生徒が、クラスのボットを開くとする。その生徒は、課題に貼り付けるための段落ではなく、教師が承認した質問やヒントを受け取れるかもしれない。教師は後で、複数の生徒が同じヒントを必要としていたことを確認し、すべての記録を読むことなく、次の授業でその誤解を取り上げ直せるかもしれない。その未来は、プライバシーを守りながら役立つパターンを浮かび上がらせるダッシュボードと、実際の会話を通じてもボットが境界を保つことにかかっている。

この研究は、まだそこまでを明らかにしていない。主に調べたのは、短いワークショップで教師がボットをテストする場面であり、教室で生徒が時間をかけて使う場面ではなかった。次の段階は、実際の生徒を対象に継続的なテストを行うことと、教える目的から外れる失敗を診断し、修正するツールを組み合わせることである。

出典

arXiv, 「Will It Teach as Intended? How Teachers Configure Educational AI Chatbots」