ActiveUltraFeedback:基于主动学习的高效偏好数据生成
机器学习
2026-03-11 v1 人工智能
计算与语言
摘要
强化学习从人类反馈(RLHF)已成为对齐大型语言模型(LLM)的标准方法,但其效果受限于获取偏好数据的高成本,尤其是在低资源和专家领域。为此,我们引入ACTIVEULTRAFEEDBACK,一个模块化的主动学习管道,利用不确定性估计动态识别最具信息性的响应进行标注。我们的管道支持对标准响应选择方法以及双向反向蒙特卡洛抽样(DOUBLE REVERSE THOMPSON SAMPLING,DRTS)和DeltaUCB(DELTAUCB)等两项新方法的系统性评估,这些方法优先考虑预测质量差距较大的响应对,基于近期研究表明,这类响应对为微调提供良好信号。我们的实验表明,ACTIVEULTRAFEEDBACK生成的高质量数据集可显著提升下游性能,尤其是在标注数据量为静态基线的六分之一时,即可实现相当或更好的效果。我们的管道已公开于https://github.com/lasgroup/ActiveUltraFeedback,偏好数据集也已上传至https://huggingface.co/ActiveUltraFeedback。
引用
@article{arxiv.2603.09692,
title = {ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning},
author = {Davit Melikidze and Marian Schneider and Jessica Lam and Martin Wertich and Ido Hakimi and Barna Pásztor and Andreas Krause},
journal= {arXiv preprint arXiv:2603.09692},
year = {2026}
}
备注
35 pages, 6 figures, 24 tables