中文

ParetoHqD:用于大型语言模型快速离线多目标对齐的帕累托高质量数据方法

机器学习 2026-01-01 v3 计算与语言

摘要

将大型语言模型与多种人类期望和价值观进行对齐,对于确保其充分满足多样化用户需求至关重要。为此,诸如奖励-上下文算法等离线多目标对齐算法已显示出强大的性能和效率。然而,不当的偏好表示以及使用不平衡的奖励分数限制了此类算法的性能。本文介绍了ParetoHqD方法,通过将人类偏好表示为目标空间中的偏好方向,并将位于帕累托前沿附近的数据视为“高质量”数据。对于每一项偏好,ParetoHqD遵循两阶段的监督式精细调优流程,其中每个阶段使用与其偏好方向最匹配的帕累托高质量训练集。实验结果表明,ParetoHqD在两个多目标对齐任务中优于五个基线方法。

关键词

引用

@article{arxiv.2504.16628,
  title  = {ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data},
  author = {Haoran Gu and Handing Wang and Yi Mei and Mengjie Zhang and Yaochu Jin},
  journal= {arXiv preprint arXiv:2504.16628},
  year   = {2026}
}

备注

Accepted as a main conference paper at AAAI 2026