超越偏好:基于人类理由与价值观的对齐原则学习
机器学习
2026-01-27 v1 计算与语言
摘要
开发和部署大型语言模型(LLM)时的一个关键考量是这些模型所对齐的人类价值观。在对齐的宪法框架中,模型被对齐到一组以自然语言指定的原则(即宪法)。然而,目前尚不清楚如何通过广泛的利益相关者输入来公平地确定这一宪法。在本工作中,我们提出了基于事实的宪法AI(GCAI),这是一个统一的框架,用于生成既能代表用户对AI的一般期望(一般原则),又能代表其交互时偏好(情境原则)的原则宪法。我们扩展了逆向宪法AI(ICAI)方法,通过利用人类为其偏好提供的理由,从人类偏好标注数据中生成情境原则。我们用从用户关于AI的价值观陈述中提取的一般原则来补充这些情境原则。我们表明,无论是在个人层面还是在广泛用于治理AI行为方面,人类都更偏好由GCAI生成的宪法,而不是由ICAI生成的宪法。此外,参与者认为GCAI宪法在道德上更具基础性、连贯性和多元性。
引用
@article{arxiv.2601.18760,
title = {Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values},
author = {Henry Bell and Lara Neubauer da Costa Schertel and Bochu Ding and Brandon Fain},
journal= {arXiv preprint arXiv:2601.18760},
year = {2026}
}