噪声增强微调:用于缓解大语言模型幻觉的技术
计算与语言
2025-05-06 v2 人工智能
摘要
大语言模型(LLM)常常产生不准确或误导性的内容幻觉。为此,我们提出Noise-Augmented Fine-Tuning (NoiseFiT),一种新型框架,利用基于信噪比(SNR)的自适应噪声注入来增强模型鲁棒性。具体而言,NoiseFiT通过动态缩放的高斯噪声选择性扰动那些被识别为高SNR(更鲁棒)或低SNR(可能欠正则化)的层。我们进一步提出一种混合损失函数,结合标准交叉熵、软交叉熵和一致性正则化,以确保在噪声训练条件下输出稳定且准确。我们的理论分析表明,自适应噪声注入是无偏且保持方差的,为以期望值中的收敛提供了强有力的保证。经典实验在多个测试和基准数据集上表明,NoiseFiT显著降低了幻觉率,常常在关键任务中匹配或优于基线性能。这些发现凸显了噪声驱动策略在实现稳健可信赖的语言建模方面的潜力,而且不会带来高昂的计算开销。鉴于实验的全面性和详尽性,我们已在W&B、Hugging Face和GitHub上公开发布了微调日志、基准评估制品和源代码,以促进进一步的研究、可访问性和可重复性。
引用
@article{arxiv.2504.03302,
title = {Noise Augmented Fine Tuning for Mitigating Hallucinations in Large Language Models},
author = {Afshin Khadangi and Amir Sartipi and Igor Tchappi and Ramin Bahmani},
journal= {arXiv preprint arXiv:2504.03302},
year = {2025}
}