推理提升大语言模型中的意见对齐
计算与语言
2026-03-13 v2 机器学习
摘要
意见建模旨在捕捉个体或群体的政治偏好,以实现数字民主等应用,使模型能够帮助制定更公平、更受欢迎的政策。鉴于其多样性、强大的泛化能力以及在多种文本到文本应用中取得的成功,大语言模型(LLM)是该任务的自然候选人。然而,由于其统计本质和有限的因果理解,他们倾向于在轻率提示下产生偏见意见。本文研究推理是否可以改善意见对齐。灵感来自近期在数学推理中通过强化学习(RL)实现的进展,我们训练模型通过结构化推理生成与轮廓一致的答案。我们在覆盖美国、欧洲和瑞士政治的三个数据集上评估了该方法。结果表明,推理增强了意见建模,与强基线方法相当,但并未完全消除偏见,这凸显了使用大语言模型构建忠实政治数字分身的必要性。通过发布我们的方法和数据集,我们为未来的大语言模型意见对齐研究奠定了坚实的基线。
引用
@article{arxiv.2603.01214,
title = {Reasoning Boosts Opinion Alignment in LLMs},
author = {Frédéric Berdoz and Yann Billeter and Yann Vonlanthen and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2603.01214},
year = {2026}
}
备注
Accepted at ICLR 2026