中文

动态噪声偏好优化:利用自合成数据实现大语言模型的自我提升

计算与语言 2026-03-17 v4

摘要

尽管大语言模型(LLMs)已取得显著成功,但其对大量人工标注数据的依赖限制了其进一步扩展的潜力。在这种情况下,利用自生成的合成数据对于无需大量人工标注的LLM微调变得至关重要。然而,当前方法往往无法确保迭代间的一致改进,性能在仅进行最少的更新后便陷入停滞。为克服这些挑战,我们提出了动态噪声偏好优化(DNPO),它将用于构建偏好对的动态样本标注与偏好优化过程中受控的、可训练的噪声注入相结合。我们的方法有效防止了停滞并实现了持续改进。在Llama-3.2-3B和Zephyr-7B的实验中,DNPO在多个基准测试上持续优于现有方法。此外,在Zephyr-7B上,DNPO在模型生成数据质量方面表现出显著提升,与基线相比在GPT-4评估中有29.4%的胜率差距。

关键词

引用

@article{arxiv.2502.05400,
  title  = {Dynamic Noise Preference Optimization: Self-Improvement of Large Language Models with Self-Synthetic Data},
  author = {Haoyan Yang and Khiem Le and Ting Hua and Shangqian Gao and Binfeng Xu and Zheng Tang and Jie Xu and Nitesh V. Chawla and Hongxia Jin and Vijay Srinivasan},
  journal= {arXiv preprint arXiv:2502.05400},
  year   = {2026}
}