幻觉去除:灵敏度 Dropout (SenD) 用于大语言模型训练
人工智能
2025-10-08 v5 计算与语言
谱理论
摘要
随着大语言模型 (LLM) 的日益普及,人们越来越担心其可靠性问题,尤其是由于幻觉——事实不准确或无关输出——引发的担忧。我们的研究探讨了训练动力学不确定性与幻觉产生之间的关系。使用 Pythia 系列模型和几种幻觉检测指标,我们分析了幻觉趋势并确定了训练期间的显著方差。为此,我们提出了灵敏度 Dropout (SenD),一种旨在通过确定性丢弃具有显著变异性的嵌入索引来减少训练期间幻觉方差的新型训练协议。此外,我们开发了一种无监督幻觉检测指标——高效特征得分 (Efficient EigenScore, EES),该指标在速度上以 2 倍的速度近似传统 EigenScore。该指标被集成到我们的训练协议中,使 SenD 能够在计算可扩展性和有效减少幻觉方差方面同时发挥作用。SenD 在 Pythia 和 Meta 的 Llama 模型的测试时可靠性方面提升了最高可达 17%,并在维基百科、医疗、法律和编程领域提升了事实准确性,而不影响下游任务性能。
关键词
引用
@article{arxiv.2410.15460,
title = {Hallucination Detox: Sensitivity Dropout (SenD) for Large Language Model Training},
author = {Shahrad Mohammadzadeh and Juan David Guerra and Marco Bonizzato and Reihaneh Rabbany and Golnoosh Farnadi},
journal= {arXiv preprint arXiv:2410.15460},
year = {2025}
}
备注
Accepted to ACL 2025, accepted to Safe Generative AI Workshop @ NeurIPS 2024. Camera-ready version for ACL 2025 (to appear). Submitted July 2025