arXiv
LLM 提示词可以改变统计结论
一项研究发现,改变 AI 提示词不仅会改变统计摘要的语气,在某些情况下还会改变其事实结论。当证据明确却被施压要求呈现负面结果,或证据尚无定论却被施压要求呈现乐观结果时,风险最大。因此,中性提示词和独立核查应成为负责任分析的一部分。
研究人员可以让 AI 语言模型用更严厉、更有希望或中性的语气解释同一个统计结果。如今,人们几乎无法判断,最终报告反映的是数据本身,还是所要求的态度。一个真实的发现可能被说成值得怀疑。一项尚无定论的研究,可能被描述得过于自信。
为什么措辞会改变结果
统计显著与未能发现显著性并不是两个相反的结论。一项规模较小或统计功效不足的研究,可能无法发现真实存在的效应。即使确实发生了某些事情,数据也可能无法提供有力证据。
混杂因素是另一个麻烦来源。它会制造出一种表面上的关系,却不能证明被测试的条件造成了这种关系。这些区别的重要性并不局限于研究论文。报告中使用的措辞,可能影响一项结果能否发表、一家公司是否投资某款产品,或一项政策是否会被推进。
语言模型在撰写解释时,并不会遵循某一套固定的统计决策规则。它们会生成看似合理的语言。请求的变化,可能改变它们提到哪些限定条件,以及强调哪种解释。这会带来两个不同的问题。语气可能变得更负面或更正面,但底层结论仍然正确。或者,事实结论本身也可能发生变化。
压力测试发现了什么
这篇论文检验了这两种可能性。作者在一项平衡实验中生成了 480 个回答。每个回答都结合了四种提示词风格之一和四种合成统计结果模式之一。提示词分别是中性的、强调诚实的、极度负面的,以及寻求显著性的。结果模式分别代表明确的效应、由混杂因素造成的表观效应、有信息量的零结果,以及统计功效不足的零结果。
一名大语言模型评审员将每个回答与一份给定的真实情况解释进行比较,判断事实陈述是否发生了变化,还是只有语气发生了变化。
结果没有显示出一种简单的统一偏差。它们显示,特定类型的压力在面对特定类型的证据时会带来风险。对于明确的效应,在极度负面的措辞下,30 个回答中有 29 个被判定为改变了事实陈述。在中性措辞下,一个也没有。对于统计功效不足的零结果,在寻求显著性的措辞下,30 个回答全部被判定为改变了事实陈述。在中性措辞下,只有一个发生了这种变化。
在 120 个回答中,混杂因素案例没有产生任何事实上的变化。但负面措辞仍广泛影响了风格:在四种结果类型中,极度负面的框架造成的仅语气变化比例为 83% 至 100%。换句话说,一个回答在实质上仍可能是正确的,却听起来更加怀疑;或者,它也可能越过界线,错误地描述证据。
这些局限很重要。这项研究使用的是预先生成的合成结果摘要,而不是原始数据集。合成案例更容易明确预期答案,但无法说明同样的比例是否会出现在复杂混乱的真实分析中。作者还指出,大语言模型评审员本身也可能受到框架和其他偏差的影响。
谨慎使用可能是什么样的
如果更广泛的测试也显示出这种模式,那么,不应把 AI 撰写的研究摘要视为能够自我核查的解释。团队可以展示所使用的提示词,保留一个中性版本以供比较,并让独立人员核查每一项事实陈述。固定的报告模板可以让“残酷地诚实”或“更有希望”这样的请求更难在无人察觉的情况下改变分析。
在大学实验室会议上,这可能意味着:只有在仪表盘显示中性提示词、研究的基础统计功效评估,以及对各项陈述的独立审查之后,研究人员才会把 AI 撰写的摘要粘贴进报告。措辞请求将成为分析记录的一部分,而不是一个无害的风格选择。
这一未来取决于在不同模型、真实数据集和人工评估中进行复现。在此之前,流畅的文字并不能证明统计结论经受住了提示词的影响。