基于增强激活方差-稀疏度的大语言模型层重要性与幻觉分析
计算与语言
2024-11-18 v1 性能
摘要
评估大语言模型中不同层的重要性对于优化模型性能和可解释性至关重要。本文首先利用激活方差-稀疏度得分探索层重要性,该得分结合归一化激活方差和稀疏度来量化每层对整体模型性能的贡献。基于 AVSS 对层进行排序并剪枝影响最小的 25%,我们在问答、语言建模和情感分类等任务上的实验表明,保留了 90% 以上的原始性能,凸显了 LLM 架构中潜在的冗余性。在 AVSS 基础上,我们提出了一个针对跨层幻觉倾向评估的增强版本。这种改进方法引入了幻觉特异性激活方差和幻觉特异性稀疏度指标,能够精确识别易产生幻觉的层。通过在这些层上引入对比学习,我们有效缓解了幻觉生成,有助于构建更鲁棒高效的 LLM(最大性能提升 12%)。我们在 NQ、SciQ、TriviaQA、TruthfulQA 和 WikiQA 数据集上的结果证明了该方法的有效性,为 LLM 的层重要性评估和幻觉缓解提供了一个综合框架。
引用
@article{arxiv.2411.10069,
title = {Layer Importance and Hallucination Analysis in Large Language Models via Enhanced Activation Variance-Sparsity},
author = {Zichen Song and Sitan Huang and Yuxin Wu and Zhongfeng Kang},
journal= {arXiv preprint arXiv:2411.10069},
year = {2024}
}
备注
20 pages, 5 figures