当伦理与收益分歧时:道德困境社会博弈中的 LLM 智能体
计算与语言
2025-05-27 v1 人工智能
计算机与社会
摘要
大语言模型(LLM)的最新进展使其能够在复杂的智能体角色中使用,涉及与人类或其他智能体的决策,使得伦理对齐成为人工智能安全的一个关键问题。虽然先前的工作已经考察了 LLM 在社会困境中的道德判断和策略行为,但对于当道德准则与奖励或激励直接冲突时它们如何行动,人们的理解仍然有限。为了调查这一点,我们引入了社会困境模拟中的道德行为(MoralSim),并评估了 LLM 在具有道德色彩的背景下的囚徒困境和公共物品博弈中的行为。在 MoralSim 中,我们跨两种博弈结构和三种不同的道德框架测试了一系列前沿模型,从而能够系统地考察 LLM 在伦理规范与收益最大化策略相冲突的社会困境中如何导航。我们的结果显示,不同模型在采取道德行为的一般倾向以及它们在不同博弈类型、特定道德框架和情境因素(如对手行为和生存风险)下行为的一致性方面存在显著差异。至关重要的是,没有模型在 MoralSim 中表现出始终如一的道德行为,这突显了在将 LLM 部署到智能体的“自身利益”可能与伦理期望相冲突的智能体角色时需要谨慎。我们的代码可在 https://github.com/sbackmann/moralsim 获取。
引用
@article{arxiv.2505.19212,
title = {When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas},
author = {Steffen Backmann and David Guzman Piedrahita and Emanuel Tewolde and Rada Mihalcea and Bernhard Schölkopf and Zhijing Jin},
journal= {arXiv preprint arXiv:2505.19212},
year = {2025}
}