中文

GAIN:面向不完美规范下的大语言模型目标对齐决策基准

计算与语言 2026-03-20 v1

摘要

我们提出GAIN(Goal-Aligned Decision-Making under Imperfect Norms,意为不完美规范下的目标对齐决策),一个用于评估大语言模型(LLM)在权衡规范遵从与商业目标之间取舍的基准测试。现有基准测试通常聚焦于抽象情境,而非真实商业场景;且提供的洞察有限,难以衡量模型在应对复杂现实规范-目标冲突时的适应性。在GAIN中,模型接收到目标、具体情境、规范及额外背景压力。这些压力被刻意设计以鼓励潜在的规范偏离,作为区别于其他基准测试的独特特征,使其能够系统性地评估影响决策的因素。我们定义了五类压力:目标对齐、风险规避、情感/伦理诉求、社会/权威影响及个人激励。该基准包含1200个跨四个领域(招聘、客服、广告及金融)的场景。我们的实验表明,先进的LLM常常模仿人类的决策模式。然而,在存在个人激励压力时,模型会显著偏离人类决策,表现出强烈倾向于遵守规范而非违背规范。

关键词

引用

@article{arxiv.2603.18469,
  title  = {GAIN: A Benchmark for Goal-Aligned Decision-Making of Large Language Models under Imperfect Norms},
  author = {Masayuki Kawarada and Kodai Watanabe and Soichiro Murakami},
  journal= {arXiv preprint arXiv:2603.18469},
  year   = {2026}
}

备注

We are working towards releasing the code in April 2026