通过架构流独立性实现可解释变换器
机器学习
2026-03-10 v1 人工智能
摘要
虽然变换器在性能方面取得佳绩,但其内部决策过程仍不透明。我们研究是否存在通过架构约束实现可解释性设计的问题,方法是通过架构流独立性:保持token流(承载符号结构)与上下文语义在分离的流中独立可观察,直到输出时才进行整合。我们通过晚期融合架构(LFA)验证了这一原则,LFA显示出在所有最终层中均可解释的符号头部,而标准变换器则在六层中的第三层显示消解;我们通过引入Token-位置依赖得分(PDS)对此效应进行量化,分别为0.276和0.058。关键的是,干预实验表明LFA具有功能模块性:抑制LFA的recency头部仅造成轻微语义损伤(Cohen's d = -0.158),而基线方法则出现灾难性 entanglement(d = -0.672)。LFA证明了架构约束改善了底层学习机制,平均稳定性为42%,而基线比较为19%和11%,其中最佳情况(12个头部中的6个位置不变)可达50%,而在过度约束情况下可完全坍塌为0%。通过防止过早 entanglement,架构独立性将模型引向语义理解而非位置启发式,从而将可解释性确立为可通过结构约束而非事后分析实现的架构设计准则。
引用
@article{arxiv.2603.07482,
title = {Interpretable-by-Design Transformers via Architectural Stream Independence},
author = {Clayton Kerce and Alexis Fox},
journal= {arXiv preprint arXiv:2603.07482},
year = {2026}
}