中文

DavIR:基于隐式奖励的大语言模型数据选择方法

机器学习 2024-12-20 v2 人工智能 计算与语言

摘要

我们提出DavIR,一种用于大语言模型(LLM)后训练的基于模型的数据选择方法。DavIR将可约简保留损失(Reducible Holdout Loss)推广到因果语言建模的核心集选择问题,并基于微调过程中损失的相对下降来量化给定数据相对于预训练LLM的可学习性,我们证明该指标与直接偏好优化(DPO)中描述的隐式奖励模型密切相关。我们表明,使用DavIR从Alpaca数据集中选出的6%数据,能够引导LLaMA和Gemma模型系列产生优于在相同模型上用完整52K数据集训练的性能。我们还表明,用DavIR压缩的Alpaca数据集可与GSM8K数据集结合,有效平衡开放域自由形式问答与数学推理能力。最后,我们将DavIR目标应用于DPO,并开发了归一化DavIR-DPO目标,与在原始DPO目标上训练相比,其在AlpacaEval上将Zephyr-7B-SFT模型的对齐性能相对提升了8%。

关键词

引用

@article{arxiv.2310.13008,
  title  = {DavIR: Data Selection via Implicit Reward for Large Language Models},
  author = {Haotian Zhou and Tingkai Liu and Qianli Ma and Yufeng Zhang and Jianbo Yuan and Pengfei Liu and Yang You and Hongxia Yang},
  journal= {arXiv preprint arXiv:2310.13008},
  year   = {2024}
}