通过广义归纳头实现可解释的下一个词元预测
计算与语言
2025-10-31 v2 人工智能
机器学习
摘要
尽管大型 Transformer 模型在预测性能上表现出色,但其缺乏可解释性限制了它们在高风险领域的应用。为解决此问题,我们提出了广义归纳头模型(GIM),这是一种受大语言模型中“归纳头”现象启发而设计的、用于下一个词元预测的可解释模型。GIM 是一个基于检索的模块,它通过结合精确的 n-gram 匹配和基于神经相似度量的模糊匹配,在输入上下文中识别相似的序列。我们在两种场景下评估 GIM:语言建模和 fMRI 响应预测。在语言建模中,GIM 将下一个词元预测的性能相较于可解释基线提升了高达 25 个百分点,显著缩小了与黑盒大语言模型的差距。在 fMRI 场景中,GIM 将神经响应预测提升了 20%,并提供了关于大脑语言选择性的见解。GIM 代表了在跨领域统一可解释性与性能方面迈出的重要一步。代码可在 https://github.com/ejkim47/generalized-induction-head 获取。
引用
@article{arxiv.2411.00066,
title = {Interpretable Next-token Prediction via the Generalized Induction Head},
author = {Eunji Kim and Sriya Mantena and Weiwei Yang and Chandan Singh and Sungroh Yoon and Jianfeng Gao},
journal= {arXiv preprint arXiv:2411.00066},
year = {2025}
}
备注
NeurIPS 2025