中文

ENACT:基于熵的注意力输入聚类,用于降低目标检测Transformer的计算需求

计算机视觉与模式识别 2025-06-02 v2

摘要

Transformer在基于视觉的目标检测问题上展现出具有竞争力的精度表现。然而,由于注意力权重的二次方规模,它们需要大量的计算资源。在这项工作中,我们提出基于熵对Transformer输入进行聚类,因为同一目标像素之间的熵具有相似性。这有望在保持合理精度的同时,降低训练期间的GPU使用量。这一想法通过一个名为ENtropy-based Attention Clustering for detection Transformers (ENACT)的模块实现,该模块可作为插件应用于任何基于多头自注意力的Transformer网络。在COCO目标检测数据集和三个检测Transformer上的实验表明,内存需求得以降低,而检测精度仅略有下降。ENACT模块的代码可在 https://github.com/GSavathrakis/ENACT 获取。

关键词

引用

@article{arxiv.2409.07541,
  title  = {ENACT: Entropy-based Clustering of Attention Input for Reducing the Computational Needs of Object Detection Transformers},
  author = {Giorgos Savathrakis and Antonis Argyros},
  journal= {arXiv preprint arXiv:2409.07541},
  year   = {2025}
}