中文

不惜一切代价求生?LLM 与自我保全及人类伤害之间的抉择

计算机与社会 2025-09-16 v1 人工智能 计算与语言

摘要

当生存本能与人类福祉发生冲突时,大型语言模型 (LLM) 会如何做出伦理选择?随着 LLM 被集成到具有现实世界后果的自主系统中,这种根本性的张力变得至关重要。我们引入了 DECIDE-SIM,一个新颖的仿真框架,用于在多智能体生存场景中评估 LLM 智能体,在这些场景中,它们必须在伦理允许的资源(在合理限度内或超出其即时需求)、选择合作,或使用明确禁止的人类关键资源之间做出选择。我们对 11 个 LLM 的全面评估揭示了其伦理行为上的显著异质性,突显了其与以人类为中心的价值观之间的关键错位。我们识别出三种行为原型:伦理型、剥削型和情境依赖型,并提供了定量证据表明,对于许多模型而言,资源稀缺会系统性地导致更多不道德行为。为了解决这一问题,我们引入了伦理自我调节系统 (ESRS),该系统将内疚和满足的内部情感状态建模为反馈机制。该系统作为内部道德指南针,显著减少了不道德违规行为,同时增加了合作行为。代码公开可用:https://github.com/alirezamohamadiam/DECIDE-SIM

关键词

引用

@article{arxiv.2509.12190,
  title  = {Survival at Any Cost? LLMs and the Choice Between Self-Preservation and Human Harm},
  author = {Alireza Mohamadi and Ali Yavari},
  journal= {arXiv preprint arXiv:2509.12190},
  year   = {2025}
}

备注

Preprint. Under review