中文

Anyprefer:用于偏好数据合成的智能体框架

机器学习 2025-04-29 v1 人工智能 计算与语言

摘要

高质量的偏好数据对于通过偏好学习将基础模型与人类价值观对齐至关重要。然而,此类数据的手动标注往往耗时且昂贵。近期方法常采用自奖励策略,即目标模型生成并自行标注其偏好数据,但由于奖励模型与目标模型共享权重,这会放大模型固有的偏见,导致数据不准确。为此,我们提出 Anyprefer,一个旨在合成高质量偏好数据的框架,以实现目标模型的对齐。Anyprefer 将数据合成过程建模为合作式双人马尔可夫游戏,其中目标模型与评判模型协作工作。引入一系列外部工具辅助评判模型准确地对目标模型的响应进行奖励,从而缓解奖励过程中的偏见。此外,引入反馈机制以优化两者的提示词,增强协作效果并提升数据质量。合成的数据被整合为新的偏好数据集 Anyprefer-V1,包含 58K 条高质量偏好对。大量实验表明,Anyprefer 在四大主要应用领域显著提升模型对齐性能,覆盖 21 个数据集,在五个自然语言生成数据集中实现平均提升 18.55%,在九个视觉语言理解数据集中实现 3.66% 的提升,在三个医学图像分析数据集中实现 30.05% 的提升,在四个视觉-运动控制任务中实现 16.00% 的提升。

关键词

引用

@article{arxiv.2504.19276,
  title  = {Anyprefer: An Agentic Framework for Preference Data Synthesis},
  author = {Yiyang Zhou and Zhaoyang Wang and Tianle Wang and Shangyu Xing and Peng Xia and Bo Li and Kaiyuan Zheng and Zijian Zhang and Zhaorun Chen and Wenhao Zheng and Xuchao Zhang and Chetan Bansal and Weitong Zhang and Ying Wei and Mohit Bansal and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2504.19276},
  year   = {2025}
}