Crisis-Bench: 评估大语言模型的战略模糊性与声誉管理能力
人工智能
2026-01-12 v1 多智能体系统
摘要
标准的安全对齐优化大语言模型(LLM)以实现通用的有益性和诚实性,有效地灌输了一种僵化的“童子军”道德。虽然这对通用助手而言是稳健的,但这种一刀切的伦理框架对需要战略模糊性和信息保留的专业领域(如公共关系、谈判和危机管理)施加了“透明度税”。为了衡量通用安全性与专业实用性之间的这一差距,我们引入了Crisis-Bench,一个评估LLM在高风险企业危机中表现的多智能体部分可观察马尔可夫决策过程(POMDP)。Crisis-Bench涵盖8个行业的80条多样化故事情节,要求一个基于LLM的公共关系(PR)智能体在为期7天的动态企业危机模拟中导航,同时管理严格分离的私人和公共叙事状态,以强制执行严格的信息不对称。与依赖静态真实答案的传统基准不同,我们引入了裁决者-市场循环:一种新颖的评估指标,其中公众情绪被裁决并转化为模拟股价,从而创建了一个现实的经济激励结构。我们的结果揭示了一个关键的两极分化:虽然一些模型屈服于伦理关切,但其他模型则展示了为稳定模拟股价而进行马基雅维利式、合法的战略信息保留能力。Crisis-Bench提供了首个评估“声誉管理”能力的量化框架,主张从僵化的道德绝对主义转向情境感知的专业对齐。
引用
@article{arxiv.2601.05570,
title = {Crisis-Bench: Benchmarking Strategic Ambiguity and Reputation Management in Large Language Models},
author = {Cooper Lin and Maohao Ran and Yanting Zhang and Zhenglin Wan and Hongwei Fan and Yibo Xu and Yike Guo and Wei Xue and Jun Song},
journal= {arXiv preprint arXiv:2601.05570},
year = {2026}
}