用于一次性时序语句定位的假设树构建
计算机视觉与模式识别
2023-01-18 v2
摘要
给定一段未裁剪视频,时序语句定位(TSL)旨在根据所给语句查询定位特定片段。尽管已有受人尊敬的工作在该任务上取得了不错的成绩,但它们严重依赖密集的视频帧标注,这需要巨大的人力来收集。本文中,我们瞄准另一个更实用且更具挑战性的设定:一次性时序语句定位(one-shot TSL),它仅用一帧标注来学习在整个视频中检索查询信息。特别地,我们为 one-shot TSL 提出了一个有效且新颖的树结构基线,称为多假设片段树(MHST),以在标注不足的情况下捕获查询感知的判别性逐帧信息。每一视频帧被视为叶节点,共享相同视觉-语言语义的相邻帧将被合并到上层非叶节点以构建树。最终,每个根节点是一个包含其叶节点连续帧的独立片段假设。在树构建过程中,我们还引入了剪枝策略以消除与查询无关节点的干扰。借助我们设计的自监督损失函数,我们的 MHST 能够生成高质量的片段假设以供与查询进行排序和选择。在两个具挑战性数据集上的实验表明,MHST 相比现有方法取得了有竞争力的性能。
引用
@article{arxiv.2301.01871,
title = {Hypotheses Tree Building for One-Shot Temporal Sentence Localization},
author = {Daizong Liu and Xiang Fang and Pan Zhou and Xing Di and Weining Lu and Yu Cheng},
journal= {arXiv preprint arXiv:2301.01871},
year = {2023}
}
备注
Accepted by AAAI2023