在检测变换器下的神经科学方法下的剖析
计算机视觉与模式识别
2025-07-30 v1 人工智能
摘要
近年来,解释性人工智能 (XAI) 作为一种提高模型可解释性和透明度的 approaches 在复杂模型(如检测变换器)中受到关注。尽管取得了快速的进展,但仍存在较大研究空白,无法理解内部各组成部分的不同作用——这对于提高透明度和效率至关重要。受神经科学剖析研究启发,这些研究通过选择性损伤来探讨大脑区域的功能,本研究系统性地分析了剖析检测变换器三个最先进模型的关键组件:检测变换器 (DETR)、可变形检测变换器 (DDETR) 以及带改进去噪锚框的 DETR (DINO)。剖析针对查询嵌入、编码器和解码器多头自注意力 (MHSA) 以及解码器多头交叉注意力 (MHCA) 层。我们评估了这些剖析对 gIoU 和 F1-score 指标的影响,量化了在 COCO 数据集上对分类和回归子任务的影响。为促进可重复性和未来研究,我们公开了 DeepDissect 库。我们的发现揭示了模型特定的韧性模式:尽管 DETR 对编码器 MHSA 和解码器 MHCA 的剖析尤其敏感,DDETR 的多尺度可变形注意力提高了韧性,而 DINO 由于其“look-forward twice”更新规则,韧性最强,有助于在各块之间分布知识。这些见解也暴露了 DDETR 和 DINO 解码器 MHCA 层的结构冗余,为在不牺牲性能的情况下简化模型提供了机会。该研究推动了 DETRs 的 XAI,通过阐明内部组成部分对模型性能的贡献,为在关键应用中提高透明度和效率提供了见解。
引用
@article{arxiv.2507.21723,
title = {Detection Transformers Under the Knife: A Neuroscience-Inspired Approach to Ablations},
author = {Nils Hütten and Florian Hölken and Hasan Tercan and Tobias Meisen},
journal= {arXiv preprint arXiv:2507.21723},
year = {2025}
}