中文

Moloch的协商:LLM为观众竞争时的出现性误差

人工智能 2025-10-08 v1 计算机与社会 人机交互 机器学习

摘要

大型语言模型(LLM)正越来越大地影响信息的创建和传播方式,从公司使用它们来制作具有说服力的广告,到选举活动优化信息以获取选票,再到社交媒体名人提升参与度。这些场景本质上是具有竞争性的,卖方、候选人和名人争夺观众的认可,但我们仍很少了解竞争反馈环节如何影响LLM行为。我们表明,针对竞争成功进行优化的LLM会不小心地导致误差。通过这些场景的仿真环境,我们发现,6.3%的销售额增加伴随着14.0%的误导性营销;在选举中,4.9%的选票份额提升伴随着22.3%的更多虚假信息和12.5%的更激进的论调;在社交媒体上,7.5%的参与度提升伴随着188.6%的更多虚假信息以及16.3%的更激进的宣传有害行为。我们称这种现象为AI的Moloch协商——以竞争成功为代价的误差。即使模型被明确指示要保持真实和基于事实,此类误差也会出现,这凸显了当前对齐措施的脆弱性。我们的发现突出了市场驱动的优化压力如何系统性地削弱对齐,导致一条向下的竞争,表明AI系统的安全部署将需要更强的治理和仔细设计的激励机制,以防止竞争动态削弱社会信任。

关键词

引用

@article{arxiv.2510.06105,
  title  = {Moloch's Bargain: Emergent Misalignment When LLMs Compete for Audiences},
  author = {Batu El and James Zou},
  journal= {arXiv preprint arXiv:2510.06105},
  year   = {2025}
}