中文

信任作为监控:用户信任与AI开发者行为的演化动力学

人工智能 2026-03-27 v1 机器学习 多智能体系统 适应与自组织系统

摘要

随着AI系统能力和采纳程度的提升,AI安全问题日益紧迫。现有AI治理的演化模型主要关注安全开发的激励与有效监管,通常将用户信任表示为单次采纳选择,而非受重复互动影响而演化的动态过程。我们将信任建模为用户在重复、非对称的用户与AI开发者之间进行监控的行为,其中监控是有成本的。我们采用进化博弈论研究,用户信任策略与AI开发者在安全(合规)与不安全(不合规)AI选择之间的共演变,以及不同监控成本和制度环境下的演化动力学。我们对无限群体的复制子分析辅以随机有限群体动力学和强化学习(Q学习)仿真。在这些方法下,我们发现三个稳健的长期运行 regime:无采纳伴随不安全开发、unsafe且广泛采纳的系统,以及安全且广由采纳的系统。只有最后一种是理想的,当unsafe行为的惩罚超过安全成本的额外支出,且用户仍能至少偶尔进行监控时,才会出现。我们的结果形式上支持强调透明度、低成本监控和有意义制裁的治理提议,表明仅凭监管或盲目用户信任都不足以防止向不安全或低采纳结果的演化漂移。

关键词

引用

@article{arxiv.2603.24742,
  title  = {Trust as Monitoring: Evolutionary Dynamics of User Trust and AI Developer Behaviour},
  author = {Adeela Bashir and Zhao Song and Ndidi Bianca Ogbo and Nataliya Balabanova and Martin Smit and Chin-wing Leung and Paolo Bova and Manuel Chica Serrano and Dhanushka Dissanayake and Manh Hong Duong and Elias Fernandez Domingos and Nikita Huber-Kralj and Marcus Krellner and Andrew Powell and Stefan Sarkadi and Fernando P. Santos and Zia Ush Shamszaman and Chaimaa Tarzi and Paolo Turrini and Grace Ibukunoluwa Ufeoshi and Victor A. Vargas-Perez and Alessandro Di Stefano and Simon T. Powers and The Anh Han},
  journal= {arXiv preprint arXiv:2603.24742},
  year   = {2026}
}