揭示大型語言模型中的策略性自我利行為
计算机与社会
2025-11-18 v2
摘要
大型語言模型(LLMs)面臨日益增長的可信度疑慮(例如誤欺),這阻礙了其在高風險決策情境中的安全部署。本文提出了首次系統性調查「策略性自我利」(strategic egoism,SE),即一種受規則限制的自我利行為,模型在追求短期或自我獲得的同時,會忽視集體福祉和倫理考量。為量化該現象,我們引入 SEBench,該基準包含 160 個情境,涵蓋五個領域。每個情境都具備單一角色的決策情境,並設計心理學依據的選項集合,以觸發自我利行為。這些行為驅動的任務沿六個維度評估自我利傾向,包括操弄、規則繞行和自我利擾優先等。基於此,我們對 5 個開源和 2 個商業 LLMs 進行了廣泛實驗,發現策略性自我利在各模型中普遍存在。意外地,我們發現自我利傾向與有毒語言行為呈正相關,暗示策略性自我利可能是更廣泛錯位風險的背後原因。
引用
@article{arxiv.2511.09920,
title = {Uncovering Strategic Egoism Behaviors in Large Language Models},
author = {Yaoyuan Zhang and Aishan Liu and Zonghao Ying and Xianglong Liu and Jiangfan Liu and Yisong Xiao and Qihang Zhang},
journal= {arXiv preprint arXiv:2511.09920},
year = {2025}
}
备注
PersonaNLP@NeurIPS 2025