中文

在说谎前思考:推理如何导致诚实

人工智能 2026-03-17 v2 计算与语言 机器学习

摘要

虽然现有大型语言模型(LLM)评估测量了欺骗率,但引发欺骗行为的 underlying 条件仍鲜有了解。我们使用一套新型的、包含变量成本的真实道德权衡数据集来探索这一问题。与人类不同的是,人类倾向于在有时间 deliberation 时变得不够诚实(Capraro, 2017; Capraro et al., 2019),我们发现推理在不同规模和多个 LLM 家族中都一致地增加了诚实程度。这一效果不仅仅是推理内容本身的函数,因为推理痕迹往往是最终行为的poor predictor。更重要的是,我们表明表示空间本身的几何结构也贡献了这一效果。具体而言,我们观察到欺骗区域是亚稳态的:欺骗性答案比诚实答案更容易被输入改写、输出重抽样和激活噪声破坏。我们将推理解释为此意义上的过程:在道德推理过程中生成 deliberative token意味着遍历表示空间的一个有偏向的轨迹,从而将模型轻微 nudging 向其更稳定的、诚实的默认值。

关键词

引用

@article{arxiv.2603.09957,
  title  = {Think Before You Lie: How Reasoning Leads to Honesty},
  author = {Ann Yuan and Asma Ghandeharioun and Carter Blum and Alicia Machado and Jessica Hoffmann and Daphne Ippolito and Martin Wattenberg and Lucas Dixon and Katja Filippova},
  journal= {arXiv preprint arXiv:2603.09957},
  year   = {2026}
}