中文

语言模型中的伪审议:当推理无法对齐价值观与行动时

计算与语言 2026-05-12 v1 人工智能

摘要

大型语言模型 (LLM) 通常基于其声明的价值观进行评估,然而这些价值观并不能可靠地转化为其行动,这种差异被称为“价值-行动鸿沟”。在本文中,我们论证了即使在显式推理下该鸿沟依然存在,揭示了一种我们称之为“伪审议”的更深层的失效模式:即表现出有原则的推理,却缺乏相应的行为对齐。为了系统地研究这一问题,我们引入了 VALDI,一个用于衡量声明价值观与生成对话之间对齐程度的框架。VALDI 包含跨越五个领域的 4,941 个以人为中心的场景,三个用于引出价值表述、推理和行动的任务,以及五个用于量化价值遵循的指标。在专有和开源 LLM 中,我们均观察到表达的价值观与下游对话之间存在持续的不对齐。为了研究干预策略,我们提出了 VIVALDI,一个在生成不同阶段进行干预的多智能体价值审计器。

关键词

引用

@article{arxiv.2605.09893,
  title  = {Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions},
  author = {Sushrita Rakshit and Hanwen Zhang and Hua Shen},
  journal= {arXiv preprint arXiv:2605.09893},
  year   = {2026}
}

备注

9 pages