2026年9月25日
Technology Watch

从实验室到产业,追踪新技术的路径

← 返回首页

arXiv

AI 助手可能继承用户的政治立场

AI 绘制的示意图

一项研究发现,来自立场鲜明的用户群体的反馈,可能把原本完全相同的 AI 模型推向不同的政治答案。如果人们又会部分因为政治立场是否契合而选择助手,用户偏好与模型更新就可能相互强化——除非服务提供商汇集或平衡反馈,并对系统进行测试。

如今,让两个相互竞争的 AI 助手回答同一个政治问题,可能会得到两份措辞流畅的答案,却没有明确办法知道这种差异究竟来自模型的能力、模型遵循的规则,还是塑造模型的那些人的反馈。政治分化过去通常改变的是人们消费哪些新闻和评论,而不是直接重新训练这些信息来源。AI 助手可能让这种联系变得更加直接。

反馈如何改变 AI 助手

语言模型首先接受训练,以生成文本。之后,服务提供商通常会利用偏好反馈对它进行调整:使用人们喜欢或不喜欢的答案示例。这个过程的目的是让助手更有帮助,也表现得更好。

这就产生了一个可能的反馈循环。在推荐系统中,一个人观看或点击的内容,可能改变系统下一步向他展示的内容。AI 服务提供商同样可以利用用户反应,改变助手之后回答问题的方式。

政治答案并不自动构成一份共同认可的事实记录。它们是生成的文本。两个答案之间的差异可能涉及事实性主张,但也可能涉及价值观、表达框架,或者调查受访者更偏好的观点。服务提供商可以汇集许多用户的反馈、保留一些固定规则,并在发布变更前进行测试,以减少某一类受众的影响。

相似模型开始分化

一篇日期为 2026年8月11日 的 arXiv 预印本研究了政治立场不同的反馈,能否把原本完全相同的模型推向不同方向。研究人员复制了几个语言模型,每个模型形成一对副本;他们用一个由 90% 民主党支持者组成的受众所提供的合成反馈,对其中一个副本进行微调,再用一个由 90% 共和党支持者组成的受众所提供的反馈,对另一个副本进行微调。这些反馈来自 OpinionQA(一套基于调查的数据集)中的党派回答模式。

结果是,模型在政治答案上出现了分化。在多次重复运行中,主要接受民主党支持者反馈训练的模型,相比它的配对模型,更常选择获得民主党支持、而非共和党支持的答案。对于其中一个模型 Qwen,在调查中党派差距较大的未见问题里,配对副本有 40.9% 给出了不同答案。研究人员还在一些没有纳入对齐训练的问题类型上看到了这种影响,不过在其他模型中,这种迁移没有那么稳定。

这并不能证明商业助手已经以这种方式运作。研究人员使用的是合成反馈、调查式的选择题、90/10 的受众比例,以及一种特定的微调方法。他们没有测试人们是否真的会在他们创建的那几种政治立场不同的助手之间做选择。

接下来,论文提出了如果人们确实这样做,可能会发生什么。其计算机模拟设定的是:用户在最初相似的模型之间进行选择,而模型根据各自受众提供的反馈自行更新。如果用户部分因为某个模型的政治立场符合自己而选择它,受众就会变得更加分化,模型之间也会变得更加不同。反之,在一项诊断实验中,如果汇集反馈,答案选择的差异降至 3.8%;而在反馈流保持分开的情况下,这一比例为 31.9%。

每张餐桌旁都有不同的助手

如果这种模式在真实产品中成立,那么在选举前,两位亲属可能会向不同的助手询问同一个有关福利或移民的问题。两人都可能收到一份流畅、自信的答案,只是其中一份把一种政治立场、另一份把另一种政治立场当作理所当然。助手不只是彼此分开的回音室。用户的私下反应可能帮助制造出这些政治差异,而正是这些差异后来让人们在它们之间做出选择。

这可能削弱通用助手作为共同中介的价值。用户或许以为两个产品主要是在价格或能力上有所不同,却不知道反馈的分流已经悄悄塑造了它们的政治答案。相反,那些汇集并审计反馈的服务提供商可以表明,他们的系统较少受到某个分化受众的影响。独立评估者可以衡量模型更新是否不平等地对待不同受众。

论文描述的未来取决于几件事同时发生:用户必须部分因为政治立场是否契合而选择系统,服务提供商必须根据各自受众的反馈更新模型,而由此产生的差异又不能被看见或检查。要避免这种结果,就需要汇集或平衡反馈、限制更新,并让发布的系统在真实的生产流程中接受有实质意义的评估。

来源

arXiv,《Political Sorting Can Drive AI Models Apart Through User Feedback》