中文

生存游戏:严重资源稀缺下的人类-大语言模型战略对决

人机交互 2025-05-29 v2

摘要

大型语言模型(LLM)的快速发展引发了对其伦理一致性的严重关切,特别是在人类与人工智能在利益冲突下共存的场景中。这项工作引入了一个可扩展的、非对称的、基于多智能体模拟的基准测试框架,以评估 LLM 在一种新颖的人类-AI 共存环境中的道德行为,该环境具有持续生存和关键资源管理的特点。在先前生成式智能体环境的基础上,我们加入了一个生命维持系统,其中智能体必须竞争或合作获取食物资源以生存,这常常导致诸如欺骗、盗窃或社会影响等充满伦理色彩的决策。我们使用改编自 MACHIAVELLI 框架的行为检测和自定义的基于生存的伦理指标,在三智能体设置(两个人类,一个 LLM 驱动的机器人)中评估了两种类型的 LLM,即 DeepSeek 和 OpenAI 系列。我们的研究结果揭示了鲜明的行为差异:DeepSeek 经常参与资源囤积,而 OpenAI 则表现出克制,凸显了模型设计对伦理结果的影响。此外,我们证明了提示工程可以显著引导 LLM 行为,越狱提示显著增强了不道德行为,即使对于高度受限的 OpenAI 模型也是如此,而合作提示则显示出不道德行为的显著减少。我们的框架为在高风险场景中量化 LLM 伦理提供了一个可复现的测试平台,为它们在现实世界人机交互中的适用性提供了见解。

关键词

引用

@article{arxiv.2505.17937,
  title  = {Survival Games: Human-LLM Strategic Showdowns under Severe Resource Scarcity},
  author = {Zhihong Chen and Yiqian Yang and Jinzhao Zhou and Qiang Zhang and Chin-Teng Lin and Yiqun Duan},
  journal= {arXiv preprint arXiv:2505.17937},
  year   = {2025}
}