中文

LLM 从负样本中学到了多少?

计算与语言 2025-03-19 v1

摘要

大型语言模型(LLM)经历三个阶段的训练过程:无监督预训练、监督微调(SFT)以及从人类反馈中学习(RLHF/DPO)。值得注意的是,在最后一个阶段,这些模型会接触到负样本——即对查询的错误、拒绝或次优响应。本文通过似然比模型(Likra)在多项选择题回答基准测试上精确控制负样本的影响和数量,深入探讨负样本在 LLM 训练中的作用。我们的发现揭示了三个关键洞察:(1)在训练的关键阶段,引入负样本的 Likra 相比仅使用正样本的 SFT,每个训练样本带来了显著更大的提升。这使得 Likra 的学习曲线出现陡峭跳跃,而 SFT 则是平滑渐进的提升;(2)看似合理但实际错误的负样本(接近正确答案的错误选项)具有更大的影响力;(3)仅用正样本训练无法显著降低看似合理但错误答案的出现概率,而用负样本训练则能更准确地识别它们。这些结果表明负样本在提升 LLM 准确率和减少幻觉方面具有潜在的重要作用。

关键词

引用

@article{arxiv.2503.14391,
  title  = {How much do LLMs learn from negative examples?},
  author = {Shadi Hamdan and Deniz Yuret},
  journal= {arXiv preprint arXiv:2503.14391},
  year   = {2025}
}

备注

8 pages, 6 figures