注意力收集,MLP 组合:视频ViT中动作-结果电路的因果分析
机器学习
2026-03-13 v1 人工智能
计算机视觉与模式识别
摘要
本文探讨了视频模型在分类任务中如何表示可能不影响最终结果的细微、隐藏语义信息,这是可信赖AI模型的一个关键挑战。在解释性和可解释AI方法的具体是,机械可解释性技术被用于逆向工程负责任表示动作结果的内部电路,在一个预训练的视频视觉变换器中,发现"成功 vs 失败"信号是通过一个独特的放大级联计算得到的。虽然从第0层观察到一些低层差异,但动作的抽象和语义表示从第5层到第11层逐渐被放大。因果分析,主要使用激活修补支持于消融结果,揭示了清晰的分工:注意力头充当"证据收集者",为部分信号恢复提供必要的低层信息,而MLP块功能作为稳健的"概念组合者",每个都作为生成"成功"信号的主要驱动力。该模型内部分布式和冗余的电路解释了其对简单消融的韧性,展示了处理人类动作结果的核心计算模式。关键的是,尽管该模型仅为简单分类训练,却发展出一种处理复杂结果的精细电路,这凸显了模型在其显式任务之外发展出\'隐藏知识\'的潜力,强调了为建立真正可解释和可信赖的AI系统所需的机制性监督。
引用
@article{arxiv.2603.11142,
title = {Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT},
author = {Sai V R Chereddy},
journal= {arXiv preprint arXiv:2603.11142},
year = {2026}
}
备注
Accepted at the AAAI 2026 Workshop on Deployable AI (DAI). Non-archival. Code and custom dataset available upon request