UNA:一种统一的监督框架用于跨反馈类型的高效 LLM 对齐
机器学习
2026-05-11 v4 计算与语言
摘要
RL 对齐方法,包括 RLHF 和 DPO,主要基于二元偏好数据。尽管某些情况下收集了标量或评分反馈,但很少直接使用,且通常忽略偏好幅度信息。此外,当前的对齐框架在统一异构监督信号方面能力有限,难以在单一训练范式中联合利用多样化数据类型。这一限制约束了对齐过程的丰富性和可扩展性。为克服这一问题,我们提出一种能够跨不同类型反馈进行训练的统一 \textbf{A}lignment (\textbf{UNA}) 框架,包括二元、二元对和评分-based 反馈,通过一种广义隐式奖励函数实现。该奖励函数通过对数和不等式被证明为最优策略。大量实验在经典基准测试上持续显示,所提出的统一框架在典型 LLM 基础模型上具有优势。
引用
@article{arxiv.2408.15339,
title = {UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types},
author = {Zhichao Wang and Bin Bi and Can Huang and Shiva Kumar Pentyala and Zixu James Zhu and Sitaram Asur and Na Claire Cheng and Cheng Wan and Dong Nie and Lingzi Hong},
journal= {arXiv preprint arXiv:2408.15339},
year = {2026}
}