面向视频时刻检索和高亮检测的循环解码器 DEtection TRansformer
计算机视觉与模式识别
2025-01-22 v1 信息检索
机器学习
摘要
视频时刻检索和高亮检测旨在基于文本查询查找视频中的对应内容。现有方法通常首先使用对比学习方法对齐视频和文本特征,然后融合和提取多模态信息,最后使用 Transformer 解码器对多模态信息进行解码。然而,现有方法面临几个问题:(1) 数据集中不同样本之间的重叠语义信息会阻碍模型的多模态对齐性能;(2) 现有模型无法有效提取视频的局部特征;(3) 现有模型使用的 Transformer 解码器无法充分解码多模态特征。为解决上述问题,我们提出了用于视频时刻检索和高亮检测任务的 LD-DETR 模型。具体而言,我们首先将相似度矩阵蒸馏为单位矩阵,以减轻重叠语义信息的影响。然后,我们设计了一种能够更高效提取视频局部特征的方法。最后,我们将 Transformer 解码器的输出反馈给自身,以更充分地解码多模态信息。我们在四个公开基准数据集上评估了 LD-DETR,并进行了大量实验以展示该方法的优越性和有效性。我们的模型在 QVHighlight、Charades-STA 和 TACoS 数据集上超越了当前最先进的方法。我们的代码已公开于 https://github.com/qingchen239/ld-detr。
引用
@article{arxiv.2501.10787,
title = {LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection},
author = {Pengcheng Zhao and Zhixian He and Fuwei Zhang and Shujin Lin and Fan Zhou},
journal= {arXiv preprint arXiv:2501.10787},
year = {2025}
}