中文

DARC:基于风险约束解码的不一致感知对齐

机器学习 2026-05-19 v2 人工智能

摘要

偏好基准对齐方法(如 RLHF、DPO)通常优化单个标量目标,隐式地对异构人类偏好进行平均。在实际应用中,系统性注释者和用户组之间的不一致使得均值奖励最大化脆弱且易受代理过度优化影响。我们提出 **基于风险约束解码的不一致感知对齐 (DARC)**,这是一种无需重新训练的推理时方法,将响应选择框架化为分布式鲁棦、风险敏感的决策问题。给定多个偏好样本或可扩展的不一致代理,DARC 通过最大化 *KL-鲁棦 (熵基) 满意目标* 对候选答案进行重新排序,并提供简单的部署控制,限制或惩罚相应的熵风险溢价相对于均值的水平,从而在无需重新训练的情况下实现明确的风险预算。我们提供了将该解码规则与原则性乐观主义和 KL 基于分布式鲁棦优化相链接的理论表征。实验在对齐基准测试上显示,DARC 在保持竞争平均质量的同时,显著降低了不一致性和尾部风险。

关键词

引用

@article{arxiv.2603.08145,
  title  = {DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding},
  author = {Mingxi Zou and Jiaxiang Chen and Junfan Li and Langzhang Liang and Qifan Wang and Xu Yinghui and Zenglin Xu},
  journal= {arXiv preprint arXiv:2603.08145},
  year   = {2026}
}