2026年9月25日
Technology Watch

從實驗室到產業,追蹤新技術的路徑

← 回首頁

arXiv

AI 助理可能從使用者身上繼承政治立場

AI 繪製的示意圖

一項研究發現,立場強烈、各有黨派傾向的使用者群體所提供的回饋,可能把原本相同的 AI 模型推向不同的政治答案。如果人們之後部分根據政治契合度選擇助理,使用者偏好和模型更新就可能彼此強化——除非供應商整合或平衡回饋,並測試自己的系統。

如今,向兩個互相競爭的 AI 助理提出同一個政治問題,可能得到兩個措辭流暢的答案,卻沒有明確方法知道差異究竟來自模型的能力、模型的規則,還是塑造模型的使用者回饋。政治分化過去通常改變的是人們接觸哪些新聞和評論,而不是直接重新訓練這些資訊來源。AI 助理可能讓這種連結變得更加直接。

回饋如何改變 AI 助理

語言模型首先接受訓練,以產生文字。在此之後,供應商通常會使用偏好回饋來調整模型:也就是人們喜歡或不喜歡的答案範例。這個過程的目標,是讓助理更有幫助,也更符合期望的行為。

這就產生了一個可能的回饋迴圈。在推薦系統中,一個人觀看或點擊的內容,可能改變系統接下來向他展示的內容。AI 供應商同樣可以利用使用者的反應,改變助理之後回答問題的方式。

政治答案並不是一份自動形成、人人共享的事實紀錄。它們是生成的文字。兩個答案之間的差異可能涉及事實主張,但也可能涉及價值觀、表述方式,或受訪者偏好的意見。供應商可以整合許多使用者的回饋、維持部分規則不變,並在發布變更前進行測試,以降低單一受眾的影響。

相似模型何時開始分裂

一篇日期為 2026 年 8 月 11 日的 arXiv 預印本背後的研究人員,測試了政治立場不同的回饋是否能把原本相同的模型推向不同方向。他們製作了幾個語言模型的成對副本,並使用一個由 90% 民主黨支持者組成的受眾所提供的合成回饋,對其中一個副本進行微調;另一個副本則使用由 90% 共和黨支持者組成的受眾所提供的回饋。這些回饋來自 OpinionQA 這個以問卷為基礎的資料集中的黨派回應模式。

結果是政治答案出現分化。在重複進行的測試中,主要以民主黨支持者回饋訓練的模型,選擇的答案相較於其配對模型,獲得更多民主黨而非共和黨受訪者的支持。以其中一個模型 Qwen 為例,在問卷中黨派差距很大的未見問題裡,成對副本有 40.9% 給出了不同答案。研究人員也在一些未納入對齊訓練的議題類型中看到了這種效果,不過這種轉移在其他模型中較不穩定。

這並不表示商業助理已經以這種方式運作。研究人員使用的是合成回饋、問卷式選擇題、90/10 的受眾比例,以及特定的微調方法。他們沒有測試人們是否真的會在自己製作的、政治立場不同的助理之間做選擇。

論文接著追問,如果人們真的這麼做,可能會發生什麼事。研究人員的電腦模擬讓使用者在原本相似的模型中做選擇,同時模型根據各自受眾提供的回饋自行更新。如果使用者部分因為某個模型的政治立場符合自己而選擇它,受眾就會變得更加分化,模型也會變得更加不同。相反地,當回饋被整合時,在一項診斷測試中,選擇差異降至 3.8%;當回饋串流保持分開時,則是 31.9%。

每張餐桌上都有不同的助理

如果這種模式在真實產品中成立,選舉前,兩位親戚可能會向不同的助理詢問同一個關於福利政策或移民的問題。兩人都可能收到流暢而自信的答案,只是每個答案都把不同的政治立場當成理所當然。這些助理不只是彼此分開的回音室。使用者私下的反應,可能幫助製造出日後促使人們在兩者之間做選擇的政治差異。

這可能削弱通用型助理作為共享中介的價值。使用者可能以為兩項產品主要是在價格或能力上有所不同,卻不知道回饋分流已悄悄塑造了它們的政治答案。相反地,整合並稽核回饋的供應商,可以證明自己的系統較不受單一分化受眾的影響。獨立評估者則可以衡量模型更新是否以不平等的方式對待不同受眾。

論文所描述的未來,取決於幾件事同時發生:使用者必須部分根據政治契合度選擇系統,供應商必須根據各自受眾的回饋更新模型,而由此產生的差異不能被看見或檢查。要避免這種結果,就需要整合或平衡回饋、限制更新,並讓發布的系統在真實的生產流程中接受有意義的評估。

來源

arXiv,「Political Sorting Can Drive AI Models Apart Through User Feedback」