社会对齐框架可改善大语言模型对齐
计算机与社会
2025-03-04 v1 人工智能
计算与语言
摘要
大语言模型(LLMs)的最新进展侧重于生成符合人类期望并与共享价值观一致的回应——这一过程被称为对齐。然而,由于人类价值观的复杂性与旨在解决这些问题的技术方法的狭隘性之间存在固有的脱节,对齐大语言模型仍然具有挑战性。当前的对齐方法常常导致目标设定错误,这反映了不完全契约这一更广泛的问题,即在模型开发者与模型之间制定一个涵盖大语言模型对齐中所有场景的契约是不切实际的。在本文中,我们主张改善大语言模型对齐需要融入来自社会对齐框架(包括社会、经济和契约对齐)的见解,并讨论了源自这些领域的潜在解决方案。鉴于不确定性在社会对齐框架中的作用,我们随后研究了它在大语言模型对齐中如何体现。在讨论的最后,我们提出了关于大语言模型对齐的另一种观点,将其目标设定不足的性质视为一个机遇,而非追求其完美规范。除了大语言模型对齐的技术改进之外,我们还讨论了参与式对齐界面设计的必要性。
引用
@article{arxiv.2503.00069,
title = {Societal Alignment Frameworks Can Improve LLM Alignment},
author = {Karolina Stańczak and Nicholas Meade and Mehar Bhatia and Hattie Zhou and Konstantin Böttinger and Jeremy Barnes and Jason Stanley and Jessica Montgomery and Richard Zemel and Nicolas Papernot and Nicolas Chapados and Denis Therien and Timothy P. Lillicrap and Ana Marasović and Sylvie Delacroix and Gillian K. Hadfield and Siva Reddy},
journal= {arXiv preprint arXiv:2503.00069},
year = {2025}
}