GPT类模型在摘要任务上的机械可解释性
计算与语言
2025-05-26 v1 人工智能
机器学习
摘要
机械可解释性研究旨在揭示大型语言模型的内部工作机制,但大多数研究聚焦于分类或生成任务,而非摘要任务。本文提出了一种用于分析GPT类模型适应摘要任务的可解释性框架。我们对预训练模型与微调后模型进行差分分析,量化注意力模式和内部激活的变化。通过识别特定层和注意力头发生显著变换的位置,我们在模型架构中定位了“摘要电路”。我们的发现表明,中间层(尤其是第2、3和5层) exhibit最显著的变化,62%的注意力头显示出熵值降低,表明其对信息选择的关注度提升。我们展示了针对这些识别出的电路进行的定向LoRA适应,相对于标准LoRA微调可实现显著的性能提升,同时所需训练轮数更少。这一工作弥合了黑盒评估与机械理解之间的鸿沟,为理解神经网络在摘要过程中如何进行信息选择和压缩提供了洞见。
引用
@article{arxiv.2505.17073,
title = {Mechanistic Interpretability of GPT-like Models on Summarization Tasks},
author = {Anurag Mishra},
journal= {arXiv preprint arXiv:2505.17073},
year = {2025}
}
备注
8 pages (6 content + 2 references/appendix), 6 figures, 2 tables; under review for the ACL 2025 Student Research Workshop