中文

逆向宪法 AI:将偏好压缩为原则

计算与语言 2025-04-22 v2 人工智能

摘要

反馈数据广泛用于微调和评估最先进的 AI 模型。其中,两两文本偏好(即人类或 AI 注释者从两个选项中选择“更好”者)尤为常见。这些偏好用于训练(奖励)模型或使用聚合统计信息对模型进行排序。对于许多应用而言,除了对偏好进行建模外,了解注释者偏好也很理想——至少因为大量的先前工作表明了偏好数据集中各种意外偏见。然而,偏好数据集仍然难以解释。既不能解释性的奖励模型,也无法通过统计数据来回答为什么一个文本被偏好于另一个文本。手动解释大量(长)响应对是同样不可行的。在本文中,我们提出了逆向宪法 AI(ICAI)问题,将两两文本偏好数据的解释建模为压缩任务。在宪法 AI 中,使用一组原则(宪法)来提供反馈并微调 AI 模型。ICAI 逆转了这个过程:给定反馈数据集,旨在提取一种最能使大型语言模型(LLM)重建原始注释的宪法。我们提出了相应的 ICAI 算法,并基于在几个数据集上的注释重建准确率对其生成的宪法进行了量化验证:(a)具有已知原则的合成反馈数据;(b)AlpacaEval 交叉注释的人类反馈数据;(c)众所捕获的 Chatbot Arena 数据;(d)来自不同人口统计学群体的 PRISM 数据。作为原始数据集的简洁且可解释的表示,生成的宪法在许多潜在用例中都有帮助:帮助识别不令人满意的注释偏见、更好地理解模型性能、扩展到不可见数据,或适应模型以适应单个用户或群体的偏好。我们在 https://github.com/rdnfn/icai 上发布了源代码。

关键词

引用

@article{arxiv.2406.06560,
  title  = {Inverse Constitutional AI: Compressing Preferences into Principles},
  author = {Arduin Findeis and Timo Kaufmann and Eyke Hüllermeier and Samuel Albanie and Robert Mullins},
  journal= {arXiv preprint arXiv:2406.06560},
  year   = {2025}
}

备注

Accepted at ICLR 2025, v2 is camera-ready version; Main changes from v1: extended experiments, additional baselines