通过检测和探索任务特定神经元理解大语言模型的多任务学习(泛化)
计算与语言
2025-01-14 v2 机器学习
摘要
尽管大语言模型(LLMs)已展现出卓越的多任务能力,但理解其背后的学习机制仍然是一个具有挑战性的问题。在本文中,我们试图从神经元的角度来理解这些机制。具体来说,我们通过基于任务特定数据的梯度归因来检测LLMs中的任务敏感神经元。通过大量的去激活和微调实验,我们证明了检测到的神经元与给定任务高度相关,我们将其称为任务特定神经元。利用这些识别出的任务特定神经元,我们深入研究了多任务学习和持续学习中的两个常见问题:泛化与灾难性遗忘。我们发现任务特定神经元的重叠与跨任务的泛化和特化密切相关。有趣的是,在LLMs的某些层中,不同任务特定神经元的参数存在高度相似性,并且这种相似性与泛化性能高度相关。受这些发现的启发,我们提出了一种神经元级别的持续微调方法,该方法在持续学习期间仅微调当前任务的特定神经元,大量实验证明了所提方法的有效性。我们的研究为LLMs在多任务学习中的可解释性提供了见解。
引用
@article{arxiv.2407.06488,
title = {Towards Understanding Multi-Task Learning (Generalization) of LLMs via Detecting and Exploring Task-Specific Neurons},
author = {Yongqi Leng and Deyi Xiong},
journal= {arXiv preprint arXiv:2407.06488},
year = {2025}
}