中文

现代大语言模型中基于不确定性的在线 DPO 中的主动选择难以打败随机

机器学习 2026-04-06 v1 人工智能

摘要

现代大语言模型继承了来自大规模预训练数据的强先验,这可能限制了后训练数据选择策略的潜在提升空间。虽然主动偏好学习(APL)旨在优化在线直接偏好优化(DPO)中的查询效率,但基于强预训练先验的在策略性候选池的内在丰富性往往使简单的随机抽样成为出人意料的强劲基线。我们对比评估了基于不确定性的 APL 与随机方法,分别用于无害性、有帮助性和遵循指令的场景,并利用奖励模型和 LLM-as-a-judge 代理。我们发现 APL 相对于随机方法几乎没有显著的提升。关键的是,我们观察到一种分离现象:获胜率提升即使一般能力——由标准基准测试衡量——恶化。APL 未能缓解这种能力崩溃,也未能显著优于随机抽样减少方差。我们的发现表明,在强预训练先验的条件下,主动选择的计算开销很难为比简单随机抽样提供的“廉价多样性”所正当化。我们的代码已公开于 https://github.com/BootsofLagrangian/random-vs-apl。

关键词

引用

@article{arxiv.2604.02766,
  title  = {Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs},
  author = {Giyeong Oh and Junghyun Lee and Jaehyun Park and Youngjae Yu and Wonho Bae and Junhyug Noh},
  journal= {arXiv preprint arXiv:2604.02766},
  year   = {2026}
}

备注

first commit