中文

双任务相互强化嵌入式联合视频段落检索与定位

计算机视觉与模式识别 2024-11-27 v1

摘要

视频段落定位(VPG)旨在精确定位与给定文本段落查询相关的视频中最合适的时刻。然而, 现有方法通常依赖大量标注的时间标签, 并假设视频与段落之间的对应关系是已知的。这在实际应用中是不实际的, 因为构建时间标签需要巨大的劳动力, 且对应关系往往是未知的。为此, 我们提出了一种双任务相互强化嵌入式联合视频段落检索与定位方法(DMR-JRG)。在该方法中, 检索任务与定位任务是相互强化的, 而不是被视为独立的问题。DMR-JRG主要由两个分支组成: 检索分支和定位分支。检索分支使用视频间对比学习, 大致对齐段落和视频的全局特征, 减少模态差异, 并构建粗粒度特征空间以摆脱段落与视频之间对应关系的需求。此外, 该粗粒度特征空间进一步促进定位分支在提取细粒度上下文表示方面的工作。在定位分支中, 我们通过探索视频片段与文本段落在局部、全局和时间维度上的一致性, 实现精确的跨模态匹配和定位。通过协同这些维度, 我们构建了视频和文本特征的细粒度特征空间, 大大降低了对大规模标注时间标签的需求。

关键词

引用

@article{arxiv.2411.17481,
  title  = {Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding},
  author = {Mengzhao Wang and Huafeng Li and Yafei Zhang and Jinxing Li and Minghong Xie and Dapeng Tao},
  journal= {arXiv preprint arXiv:2411.17481},
  year   = {2024}
}

备注

This work has been accepted with mandatory minor revisions by TMM