MH-DETR:基于跨模态 Transformer 的视频时刻与高亮检测
计算机视觉与模式识别
2023-05-05 v1 人工智能
摘要
随着视频理解需求的增长,视频时刻与高亮检测(MHD)已成为关键研究课题。MHD 旨在同时定位所有时刻并预测片段级显著性分数。尽管现有基于 DETR 的方法取得了进展,我们观察到这些方法粗略融合不同模态的特征,削弱了时序单模态上下文并导致跨模态交互不足。为解决此问题,我们提出专为 MHD 设计的 MH-DETR(Moment and Highlight Detection Transformer)。具体而言,我们在单模态编码器内引入一个简单而高效的池化算子以捕获全局单模态上下文。此外,为获得时序对齐的跨模态特征,我们在编码器与解码器之间设计了一个即插即用的跨模态交互模块,无缝整合视觉与文本特征。在 QVHighlights、Charades-STA、Activity-Net 和 TVSum 数据集上的综合实验表明,MH-DETR 优于现有最先进方法,证明了其有效性与优越性。我们的代码见 https://github.com/YoucanBaby/MH-DETR。
引用
@article{arxiv.2305.00355,
title = {MH-DETR: Video Moment and Highlight Detection with Cross-modal Transformer},
author = {Yifang Xu and Yunzhuo Sun and Yang Li and Yilei Shi and Xiaoxiang Zhu and Sidan Du},
journal= {arXiv preprint arXiv:2305.00355},
year = {2023}
}