基于多线程知识迁移网络的多对 temporal 句子定位
计算机视觉与模式识别
2026-05-26 v3
摘要
给定一些包含未剪辑视频和句子查询的视频-查询对,temporal 句子定位 (TSG) 旨在在这些视频中定位与查询相关的片段。尽管以前的优秀 TSG 方法取得了显著的成功,但它们分别训练每个视频-查询对,忽略了不同对之间的关系。我们观察到,类似的视频/查询内容不仅有助于 TSG 模型更好地理解和泛化跨模态表示,还能帮助模型定位一些复杂的视频-查询对。以往的方法遵循单线程框架,无法共同训练不同的对,通常花费大量时间获取冗余知识,限制了其实际应用。为此,本文提出一种全新的设置:多对 TSG,即旨在共同训练这些对。具体而言,我们提出了一种新颖的视频-查询共训练方法——多线程知识迁移网络,以有效且高效地定位各种视频-查询对。首先,我们挖掘不同查询之间的空间和时序语义,以相互协作。为同时学习内模和跨模态表示,我们设计了跨模态对比模块,通过自监督策略探索语义一致性。为充分对齐不同对之间的视觉和文本表示,我们设计了原型对齐策略,以实现空间对齐(匹配对象原型和短语原型)和时序对齐(对齐活动原型和句子原型)。最后,我们开发了一个自适应负采样模块,用于自适应生成跨模态匹配的阈值。大量实验表明,我们提出的方法在有效性和效率方面均表现优异。
引用
@article{arxiv.2412.15678,
title = {Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network},
author = {Xiang Fang and Wanlong Fang and Changshuo Wang and Daizong Liu and Keke Tang and Jianfeng Dong and Pan Zhou and Beibei Li},
journal= {arXiv preprint arXiv:2412.15678},
year = {2026}
}
备注
Accepted by AAAI 2025