用于时序动作检测的自反馈DETR
计算机视觉与模式识别
2023-08-22 v1
摘要
时序动作检测(TAD)具有挑战性,但对现实世界视频应用至关重要。近来,基于DETR的模型已被设计用于TAD,但表现尚不佳。本文指出DETR用于TAD时自注意力的问题:注意力模块聚焦于少数关键元素,称为时间坍塌问题。由于编码器与解码器的自注意力模块不起作用,其能力被削弱。为解决该问题,我们提出新框架Self-DETR,利用解码器的交叉注意力图重新激活自注意力模块。我们通过交叉注意力图与其转置的简单矩阵乘法恢复编码器特征间关系;同理,我们也获得解码器查询内部的信息。以所计算的引导图引导坍塌的自注意力图,我们消除了编码器与解码器中自注意力模块的时间坍塌。大量实验表明,Self-DETR通过保持各层注意力的高多样性解决了时间坍塌问题。
引用
@article{arxiv.2308.10570,
title = {Self-Feedback DETR for Temporal Action Detection},
author = {Jihwan Kim and Miso Lee and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2308.10570},
year = {2023}
}
备注
Accepted to ICCV 2023