中文

大语言模型是否信任 AI 监管?游戏论大语言模型智能体的新兴行为

人工智能 2025-04-14 v1 计算机与社会 计算机科学与博弈论 混沌动力学

摘要

普遍认为,在 AI 开发生态系统中培育信任与合作,对于推动可信赖 AI 系统的采纳至关重要。通过将大型语言模型(Large Language Model, LLM)智能体嵌入进化博弈论(evolutionary game theory, EGT)框架,本文探讨了 AI 开发者、监管者和用户之间复杂的互动,建模其在不同监管情景下的战略选择。进化博弈论用于量化建模每位行动者面临的困境,LLM 引入了额外的复杂性与细微差别,使其能够进行重复博弈并纳入人格特征。我们的研究识别出战略 AI 智能体的新兴行为,这些行为倾向于采用更“悲观”(不信任、欺骗)姿态,而非纯粹的博弈论智能体。我们观察到,在用户完全信任的情况下,激励措施能够有效促进有效的监管;但在条件信任情况下,可能恶化“社会契约”。建立用户信任与监管者声誉之间的良性反馈似乎是引导开发者创建安全 AI 的关键。然而,这种信任的出现水平可能取决于用于测试的具体 LLM。我们的结果为 AI 监管系统提供了指导,并帮助预测使用 LLM 辅助监管时战略 LLM 智能体的行为结果。

关键词

引用

@article{arxiv.2504.08640,
  title  = {Do LLMs trust AI regulation? Emerging behaviour of game-theoretic LLM agents},
  author = {Alessio Buscemi and Daniele Proverbio and Paolo Bova and Nataliya Balabanova and Adeela Bashir and Theodor Cimpeanu and Henrique Correia da Fonseca and Manh Hong Duong and Elias Fernandez Domingos and Antonio M. Fernandes and Marcus Krellner and Ndidi Bianca Ogbo and Simon T. Powers and Fernando P. Santos and Zia Ush Shamszaman and Zhao Song and Alessandro Di Stefano and The Anh Han},
  journal= {arXiv preprint arXiv:2504.08640},
  year   = {2025}
}