中文

面向多目标测试时对齐的统一自回归奖励模型

计算与语言 2026-02-11 v1

摘要

多目标对齐旨在使LLM响应与多个人类偏好目标保持一致。目前方法中,通过自回归奖励模型(ARMs)引导冻结LLM生成以实现多目标测试时对齐是一种低成本方案。然而,这些方法通常依赖于每个偏好目标的独立参数,要么通过在偏好维度上独立训练ARMs而忽略偏好特征之间的相互作用,要么通过训练单个ARMs并使用针对每个偏好的独立特征提取模块,可能导致特征交叉。两种策略都可能导致生成输出与用户偏好之间的对齐不足。为此,我们提出了首选调制与共享低秩适配(Preference-Modulated & Shared Low-Rank Adaptation, MoSLoRA)用于ARMs训练,该方法首先通过偏好无关模块提取共享特征,然后通过条件于混合偏好向量的偏好调制模块对共享特征应用仿射变换。此设计缓解了特征交叉,并在推理期间实现对偏好权衡的精确控制。基于此,我们引入了统一自回归奖励模型(Unified Autoregressive Reward Model, UniARM),用于多目标测试时对齐的新型框架。UniARM在单个参数空间中联合建模所有偏好维度,无需为每个偏好目标使用独立参数。

关键词

引用

@article{arxiv.2602.09538,
  title  = {UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment},
  author = {Hongyan Xie and Yikun Ban and Ruiyu Fang and Zixuan Huang and Deqing Wang and Jianxin Li and Yitong Yao and Chao Wang and Shuangyong Song},
  journal= {arXiv preprint arXiv:2602.09538},
  year   = {2026}
}

备注

Under Review