QD-VMR:面向视频时刻检索的查询去偏模型
人工智能
2024-08-26 v1
摘要
视频时刻检索(VMR)旨在检索与查询对应的未裁剪视频中相关时刻。虽然跨模态交互方法在过滤查询不相关信息方面取得了进展,但它们假设查询语义与相应视频时刻之间存在精确对齐,可能忽略了自然语言语义的误解。为此,我们提出了一种新型模型 \textit{QD-VMR},一种具有增强上下文理解能力的查询去偏模型。首先,我们通过视频片段和查询特征对齐以及视频-查询对比学习,利用全局局部对齐模块来增强模型的跨模态理解能力。随后,我们采用查询去偏模块高效获取去偏查询特征,采用视觉增强模块细化与查询相关的视频特征。最后,我们采用 DETR 结构预测可能的目标视频时刻。通过对三个基准数据集的广泛评估,QD-VMR 实现了最佳性能,证明了其提升 VMR 准确率的潜力。进一步的分析实验证明了我们所提出模块的有效性。我们的代码将公开,以促进未来研究。
引用
@article{arxiv.2408.12981,
title = {QD-VMR: Query Debiasing with Contextual Understanding Enhancement for Video Moment Retrieval},
author = {Chenghua Gao and Min Li and Jianshuo Liu and Junxing Ren and Lin Chen and Haoyu Liu and Bo Meng and Jitao Fu and Wenwen Su},
journal= {arXiv preprint arXiv:2408.12981},
year = {2024}
}
备注
9 pages, 4 figures, 4 tables