中文

STAA:用于实时解读基于 Transformer 的视频模型的时空注意力归因

计算机视觉与模式识别 2024-11-04 v1 人工智能

摘要

基于 Transformer 的模型已在各种计算机视觉任务中取得了最先进的性能,包括图像和视频分析。然而,Transformer 复杂的架构和黑箱特性为可解释性带来了挑战,而可解释性对于实际应用和科学研究至关重要。当前的可解释人工智能(XAI)方法仅能提供一维特征重要性,即空间或时间解释,且计算复杂度较高。本文提出了 STAA(Spatio-Temporal Attention Attribution),一种用于解读视频 Transformer 模型的 XAI 方法。与分别对空间特征应用图像 XAI 技术或对时间方面进行片段贡献分析的传统方法不同,STAA 能够同时从 Transformer 的注意力值中提供空间和时间信息。该研究使用了 Kinetics-400 数据集,这是一个包含 400 个人类动作类别的基准数据集,用于动作识别研究。我们引入了用于量化解释的评估指标。我们还应用了优化方法来增强 STAA 的原始输出。通过实现动态阈值和注意力聚焦机制,我们提高了解释中的信噪比,从而获得了更精确的可视化效果和更好的评估结果。在计算开销方面,我们的方法仅需传统 XAI 方法不到 3% 的计算资源,使其适用于实时视频 XAI 分析应用。STAA 通过为研究人员和实践者提供一种分析 Transformer 模型的方法,为不断发展的 XAI 领域做出了贡献。

关键词

引用

@article{arxiv.2411.00630,
  title  = {STAA: Spatio-Temporal Attention Attribution for Real-Time Interpreting Transformer-based Video Models},
  author = {Zerui Wang and Yan Liu},
  journal= {arXiv preprint arXiv:2411.00630},
  year   = {2024}
}