DavIR:基于隐式奖励的大语言模型数据选择方法
机器学习
2024-12-20 v2 人工智能
计算与语言
摘要
我们提出DavIR,一种用于大语言模型(LLM)后训练的基于模型的数据选择方法。DavIR将可约简保留损失(Reducible Holdout Loss)推广到因果语言建模的核心集选择问题,并基于微调过程中损失的相对下降来量化给定数据相对于预训练LLM的可学习性,我们证明该指标与直接偏好优化(DPO)中描述的隐式奖励模型密切相关。我们表明,使用DavIR从Alpaca数据集中选出的6%数据,能够引导LLaMA和Gemma模型系列产生优于在相同模型上用完整52K数据集训练的性能。我们还表明,用DavIR压缩的Alpaca数据集可与GSM8K数据集结合,有效平衡开放域自由形式问答与数学推理能力。最后,我们将DavIR目标应用于DPO,并开发了归一化DavIR-DPO目标,与在原始DPO目标上训练相比,其在AlpacaEval上将Zephyr-7B-SFT模型的对齐性能相对提升了8%。
引用
@article{arxiv.2310.13008,
title = {DavIR: Data Selection via Implicit Reward for Large Language Models},
author = {Haotian Zhou and Tingkai Liu and Qianli Ma and Yufeng Zhang and Jianbo Yuan and Pengfei Liu and Yang You and Hongxia Yang},
journal= {arXiv preprint arXiv:2310.13008},
year = {2024}
}