中文

理解和改进指令微调中的噪声嵌入技术

机器学习 2026-05-25 v1 人工智能 机器学习

摘要

近期的指令微调技术进步注入了嵌入层噪声,NEFTune(Jain 等,2024)通过使用均匀噪声设定了基准。尽管 NEFTune 的实证研究表明均匀噪声优于高斯噪声,但这种现象的原因仍不明确。本文旨在通过理论和实证分析澄清这一问题,指出两种噪声类型性能相当。此外,我们引入了一种新的语言模型微调方法,利用嵌入中的对称噪声。该方法旨在通过更严格地调节模型的局部曲率来增强模型性能,在当前方法(NEFTune)之上Demonstrates superior performance. 使用 Alpaca 对 LLaMA-2-7B 模型进行微调时,标准技术 yield 29.79% 的 AlpacaEval 分数。然而,我们的方法 SymNoise 将此分数显著提高到 69.04%,使用对称噪声嵌入。这比最先进的方法 NEFTune(64.69%)提高了 6.7%。此外,在多种模型和更强大的基线指令数据集(如 Evol-Instruct、ShareGPT、OpenPlatypus)上测试时,SymNoise 持续优于 NEFTune。当前文献,包括 NEFTune,都强调了对语言模型微调中基于噪声的策略进行更深入研究的重要性。我们的 SymNoise 方法是迈向这一目标的又一个重要步骤,显示出对现有最先进方法的显著改进。

关键词

引用

@article{arxiv.2605.23171,
  title  = {Understanding and Improving Noisy Embedding Techniques in Instruction Finetuning},
  author = {Abhay Yadav},
  journal= {arXiv preprint arXiv:2605.23171},
  year   = {2026}
}

备注

arXiv admin note: substantial text overlap with arXiv:2312.01523