中文

KS-DETR:检测 Transformer 中注意力学习的知识共享

计算机视觉与模式识别 2023-03-17 v2 机器学习

摘要

缩放点积注意力对查询和键的缩放点积应用 softmax 函数来计算权重,然后将权重与值相乘。在这项工作中,我们研究如何改进缩放点积注意力的学习以提升 DETR 的准确率。我们的方法基于以下观察:在权重/值学习中使用真实前景-背景掩码(GT Fg-Bg Mask)作为额外线索能够学习到好得多的权重/值;有了更好的权重/值,就可以学习到更好的值/权重。我们提出一个三重注意力模块,其中第一个注意力是普通的缩放点积注意力,第二/第三个注意力生成高质量权重/值(借助 GT Fg-Bg Mask)并与第一个注意力共享值/权重以提升值/权重的质量。第二和第三个注意力在推理时被移除。我们称我们的方法为知识共享 DETR(KS-DETR),它是知识蒸馏(KD)的一种扩展:教师(第二和第三个注意力)改进后的权重和值被学生(第一个注意力)直接共享而非模仿,从而实现从教师到学生更高效的知识的迁移。在各种类 DETR 方法上的实验表明,在 MS COCO 基准上相较基线方法有一致的提升。代码见 https://github.com/edocanonymous/KS-DETR。

关键词

引用

@article{arxiv.2302.11208,
  title  = {KS-DETR: Knowledge Sharing in Attention Learning for Detection Transformer},
  author = {Kaikai Zhao and Norimichi Ukita},
  journal= {arXiv preprint arXiv:2302.11208},
  year   = {2023}
}