通过探究词级激活实现小型语言模型的可解释性
机器学习
2026-05-22 v1
摘要
基于 Transformer 的语言模型如 BERT 参数超过 1.1 亿,已彻底改变自然语言理解领域,但其内部机制对研究人员和实践者而言仍然是黑盒。传统的注意力解释方法往往强调结构性重要但语义较弱的词,如标点符号,而非有意义的语义关系。本工作引入一种轻量且对模型无关的框架,用于量化词级表示的重要性,方法是计算 BERT 第 8 层隐藏状态激活强度。提出的激活流网络(AFN)框架使用第 8 层隐藏表示的 L2 范数计算词级激活强度,从而实现对语义显著词的直接排序。本文进一步引入基于阈值的激活桶公式,将词分为 HIGH 激活和 LOW 激活两组,采用经验上四分之三的激活边界作为阈值。实验观察表明,语义有意义的内容词始终占据 HIGH 激活桶并主导表示激活的转移,而结构性支持词的贡献相对较小。结果表明,第 8 层是关键的语义整合区,平衡了结构和语义信息的处理。通过揭示激活强度如何集中在语义信息丰富的词上,本工作为从注意力中心分析提供一种可解释且计算效率高的替代方案,推动了 BERT 从“黑盒”向更透明的“玻璃盒”模型转变,以促进自然语言理解。
引用
@article{arxiv.2605.22377,
title = {Towards Explainability of SLMs by investigating Token Level Activation},
author = {Sayantani Ghosh and Rajashik Datta and Amit Kumar Das and Amlan Chakrabarti},
journal= {arXiv preprint arXiv:2605.22377},
year = {2026}
}