中文

MiCRo:用于个性化偏好学习的混合建模与上下文感知路由

人工智能 2025-09-24 v2 计算与语言

摘要

在应用基于人类反馈的强化学习(RLHF)来对齐大型语言模型(LLM)时,奖励建模是构建安全基础模型的关键步骤。然而,基于 Bradley-Terry(BT)模型的奖励建模假设存在一个全局奖励函数,无法捕捉本质上多样且异质的人类偏好。因此,这种过度简化限制了 LLM 支持个性化和多元化对齐的能力。在理论上,我们证明了当人类偏好遵循由不同子群组成的混合分布时,单一 BT 模型存在不可约误差。虽然现有的解决方案(例如使用细粒度标注的多目标学习)有助于解决这一问题,但它们成本高昂且受限于预定义属性,无法完全捕捉人类价值观的丰富性。在这项工作中,我们引入了 MiCRo,这是一个两阶段框架,通过利用大规模二元偏好数据集来增强个性化偏好学习,而无需显式的细粒度标注。在第一阶段,MiCRo 引入了上下文感知的混合建模方法来捕捉多样的人类偏好。在第二阶段,MiCRo 集成了在线路由策略,该策略根据特定上下文动态调整混合权重以解决歧义,从而允许在最少额外监督下进行高效且可扩展的偏好适应。在多个偏好数据集上的实验表明,MiCRo 有效地捕捉了多样的人类偏好,并显著改善了下游个性化。

关键词

引用

@article{arxiv.2505.24846,
  title  = {MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning},
  author = {Jingyan Shen and Jiarui Yao and Rui Yang and Yifan Sun and Feng Luo and Rui Pan and Tong Zhang and Han Zhao},
  journal= {arXiv preprint arXiv:2505.24846},
  year   = {2025}
}