TE-TAD:通过时间对齐坐标表达实现全端到端时序动作检测
计算机视觉与模式识别
2024-04-05 v2
摘要
在本文中,我们研究了归一化坐标表达是基于查询的时序动作检测(TAD)检测器中依赖手工组件的关键因素。尽管在目标检测中向端到端框架取得了显著进展,但基于查询的检测器在TAD中实现全端到端建模方面仍受到限制。为了解决这个问题,我们提出了TE-TAD,一种全端到端时序动作检测变换器,它集成了时间对齐的坐标表达。我们利用实际时间线值重新表述坐标表达,确保在极其多样的视频时长环境中具有长度不变性表示。此外,我们提出的自适应查询选择根据视频长度动态调整查询数量,与固定查询集相比,为变化的视频时长提供了合适的解决方案。我们的方法不仅通过消除对手工组件的需求简化了TAD过程,而且显著提高了基于查询的检测器的性能。我们的TE-TAD优于先前的基于查询的检测器,并在流行的基准数据集上达到了与最先进方法相竞争的性能。代码可在 https://github.com/Dotori-HJ/TE-TAD 获取。
引用
@article{arxiv.2404.02405,
title = {TE-TAD: Towards Full End-to-End Temporal Action Detection via Time-Aligned Coordinate Expression},
author = {Ho-Joong Kim and Jung-Ho Hong and Heejo Kong and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2404.02405},
year = {2024}
}