面向单正标签下多样化时序定位的研究
计算机视觉与模式识别
2023-03-14 v1
摘要
时序定位旨在通过语言查询在未裁剪视频中检索所描述事件的片段。现有方法通常假设标注精确且唯一,但一个查询在多数情况下可描述多个片段。因此,简单地将其视为一对一映射任务并力求匹配单标签标注,将不可避免地在优化中引入假阴性。本研究将该任务重构为单正标签条件下的一对多优化问题。未标注片段被视为未观测而非负样本,我们探索挖掘潜在正片段以辅助多片段检索。在此设定下,我们提出一种称为DTG-SPL的新型多样化时序定位框架,主要由正片段估计(PME)模块与多样化片段回归(DMR)模块构成。PME利用语义重建信息与期望正则化以在线方式揭示潜在正片段。在这些伪正样本监督下,DMR能够并行定位满足不同用户的多样化片段。整个框架支持端到端优化与快速推理。在Charades-STA与ActivityNet Captions上的大量实验表明,我们的方法在单标签与多标签指标上均取得优越性能。
引用
@article{arxiv.2303.06545,
title = {Towards Diverse Temporal Grounding under Single Positive Labels},
author = {Hao Zhou and Chongyang Zhang and Yanjun Chen and Chuanping Hu},
journal= {arXiv preprint arXiv:2303.06545},
year = {2023}
}
备注
The source codes are available at https://github.com/zhouhaocv/DTG-SPL