中文

TR-DETR:用于联合时刻检索与高光检测的任务互惠 Transformer

计算机视觉与模式识别 2024-01-08 v2 多媒体

摘要

基于自然语言查询的视频时刻检索 (MR) 和高光检测 (HD) 是两个高度相关的任务,旨在获取视频中的相关时刻以及每个视频片段的高光得分。最近,几种方法致力于构建基于 DETR 的网络以联合解决 MR 和 HD 问题。这些方法 simply 在多模态特征提取和特征交互后添加两个独立的任务头,取得了良好的性能。然而,这些方法未能充分利用两个任务之间的互惠关系。在本文中,我们提出了一种基于 DETR 的任务互惠 Transformer (TR-DETR),专注于探索 MR 和 HD 之间固有的互惠性。具体而言,首先构建了一个局部 - 全局多模态对齐模块,将来自不同模态的特征对齐到共享的潜在空间中。随后,设计了一种视觉特征细化机制,以消除视觉特征中与查询无关的信息用于模态交互。最后,构建了一个任务协作模块,利用 MR 和 HD 之间的互惠性来优化检索流程和高光得分预测过程。在 QVHighlights、Charades-STA 和 TVSum 数据集上的综合实验表明,TR-DETR 优于现有的最先进 (SOTA) 方法。代码地址:\url{https://github.com/mingyao1120/TR-DETR}。

关键词

引用

@article{arxiv.2401.02309,
  title  = {TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection},
  author = {Hao Sun and Mingyao Zhou and Wenjing Chen and Wei Xie},
  journal= {arXiv preprint arXiv:2401.02309},
  year   = {2024}
}

备注

Accepted by AAAI-24