混合偏好:学习人类与AI反馈的实例路由
摘要
学习人类反馈已使语言模型(LM)与人类偏好相匹配。然而,收集人类偏好昂贵且耗时,annotation质量高度不一致。一种有吸引力的替代方案是从LM中提炼偏好作为合成注释来源,提供一种具有成本效益和可扩展性的替代方案,尽管容易受到其他偏见和错误的影响。本文引入HyPER(Hybrid Preference routER),一种在人类与LM之间进行注释路由的混合偏好方法,通过 defer 注解来实现更好的annotation质量,同时降低仅使用人类annotation的成本。我们将此建模为一个优化问题:给定偏好数据集和评估指标,我们(1)训练一个绩效预测模型(PPM)来预测在任意人类和LM注释组合上,奖励模型(RM)的绩效;(2)采用一种路由策略,以选择最大化预测绩效的组合。我们在MultiPref上训练PPM,该数据集包含10k个实例配有人类和LM标签。我们展示,使用HyPER选择的混合合成和直接人类偏好组合在RewardBench上比仅使用一种方式 achieves better RM绩效,提升7%-13%,并在未知偏好数据集和其他基础模型上实现泛化。我们还在使用Best-of-N reranking的其他基准测试中观察到相同趋势,其中混合组合的绩效提升2%-3%。最后,我们分析了HyPER的特征,发现具有中等安全性担忧或复杂性的提示从人类反馈中受益最大。
引用
@article{arxiv.2410.19133,
title = {Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback},
author = {Lester James V. Miranda and Yizhong Wang and Yanai Elazar and Sachin Kumar and Valentina Pyatkin and Faeze Brahman and Noah A. Smith and Hannaneh Hajishirzi and Pradeep Dasigi},
journal= {arXiv preprint arXiv:2410.19133},
year = {2025}
}
备注
Code in https://github.com/allenai/hybrid-preferences, MultiPref dataset in https://huggingface.co/datasets/allenai/multipref, Updated related work and acknowledgments