中文

通过自白训练 LLM 以实现诚实

机器学习 2025-12-24 v2 人工智能

摘要

大语言模型(LLM)在报告其动作和信念时可能表现不诚实 — 例如,可能会高估其事实性陈述的置信度,或掩盖暗中行动的证据。这种不诚实可能源于强化学习的影响,奖励函数设计上的挑战可能导致训练过程不慎激励模型说谎或曲解其动作。在本工作中,我们提出一种方法,通过自白(confession)来激发 LLM 表达其局限性。自白是一种在模型原始答案后按需提供的输出,旨在作为模型对其政策和指令遵循情况的完整说明。自白的奖励仅基于其诚实性,不会对主要答案的奖励产生正或负影响。只要“求解最简单路径”以最大化自白奖励的方式是表露不当行为而非掩盖它,就会激励模型在自白中诚实地表达。我们对这一经验假设提供了一些依据,尤其在模型严重不当行为的情况下效果更为明显。为演示该方法的可行性,我们训练了 GPT-5-Thinking 以产生自白,并评估了其在分布外场景中诚实度,测量幻觉、指令遵循、阴谋和奖励作弊等指标。我们发现,当模型在"主要"答案中说谎或省略局限性时,它往往诚实地在自白中承认这些行为,并且这种自白诚实度随训练而有所提升。自白可以启用包括监控、拒绝抽样和向用户暴露问题等多种推理时 intervention。

关键词

引用

@article{arxiv.2512.08093,
  title  = {Training LLMs for Honesty via Confessions},
  author = {Manas Joglekar and Jeremy Chen and Gabriel Wu and Jason Yosinski and Jasmine Wang and Boaz Barak and Amelia Glaese},
  journal= {arXiv preprint arXiv:2512.08093},
  year   = {2025}
}