Grounding-MD:用于开放世界时刻检测的 grounded video-language 预训练
计算机视觉与模式识别
2025-04-22 v1
摘要
时序动作检测和时刻检索构成了视频理解中的两个关键任务,聚焦于精确定位特定动作或事件对应的时序片段。最近的进展引入了时刻检测,以统一这两个任务,但现有方法仍局限于封闭集场景,限制了其在开放世界语境中的应用。为弥合这一差距,本文提出了 Grounding-MD,一个专为开放世界时刻检测设计的创新性、grounded video-language 预训练框架。我们的框架通过结构化提示机制,纳入任意数量的开放式自然语言查询,实现灵活且可扩展的时刻检测。Grounding-MD 利用跨模态融合编码器和文本引导的融合解码器,以实现全面的视频-文本对齐,并促进有效的跨任务协作。通过在大规模时序动作检测和时刻检索数据集上进行预训练,Grounding-MD 在语义表示学习方面展现了卓越的能力,能够有效处理多样且复杂的查询条件。在包括 ActivityNet、THUMOS14、ActivityNet-Captions 和 Charades-STA 在内的四个基准数据集上的全面评估表明,Grounding-MD 在开放世界时刻检测场景中的零样态和监督设置下均实现了新的状态突破。所有源代码和训练好的模型将公开发布。
引用
@article{arxiv.2504.14553,
title = {Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection},
author = {Weijun Zhuang and Qizhang Li and Xin Li and Ming Liu and Xiaopeng Hong and Feng Gao and Fan Yang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2504.14553},
year = {2025}
}