中文

超越序数偏好:为何对齐需要基数类人类反馈

人工智能 2025-08-13 v1

摘要

对齐技术依赖于优化基于偏好的目标 —— 这些偏好通常以序数、二进制选择的形式呈现。近期工作致力于提高标签质量或缓解特定偏见,但我们识别出更根本的局限性:这些方法收集的数据类型错误。我们提出了一个不可避免性结果:仅依赖序数比较的算法无法系统性地恢复最受偏好的模型。直观地说,序数数据缺乏解决权衡(例如:在一个提示上修复事实错误与在另一个提示上改进风格)所需的信息。我们表明,选择最优模型需要恢复关于 "模型"(而非仅是响应)的偏好,而这只能通过关于响应质量的基数反馈来实现。为此,我们收集并公开发布了一套 25,000 条基数判断数据,采用实验经济学中已建立的意愿支付工具。实证结果表明,将基数反馈纳入偏好微调后,模型能够优先处理高影响力的改进,并在Arena-Hard等下游基准测试中超越仅使用序数方法。

关键词

引用

@article{arxiv.2508.08486,
  title  = {Beyond Ordinal Preferences: Why Alignment Needs Cardinal Human Feedback},
  author = {Parker Whitfill and Stewy Slocum},
  journal= {arXiv preprint arXiv:2508.08486},
  year   = {2025}
}