基于显著性的分层负样本排序:用于组合时序 grounding的SHINE
计算机视觉与模式识别
2024-07-16 v2
摘要
时序 grounding也称为视频片段检索,旨在定位与给定查询句子对应的视频片段。自然语言的组合性质使其能够实现预定义事件之外的本地化,给组合泛化性现有方法带来了挑战。最近的研究通过分解-重构方式建立视频与查询之间的对应关系,以实现组合泛化。然而,他们仅考虑主导原语,并通过随机采样和重组来构建负查询,导致生成的负查询在语义上不够合理,阻碍模型学习理性的组合。在此基础上,最近的DETR-based方法在组合时序 grounding中表现不佳,当给定与正查询略有差异的负查询时,显示出不理性的显著性响应。为解决这些限制,我们首先提出一种基于大型语言模型的方法用于负查询构建,利用GPT-3.5-Turbo生成语义上合理的硬负查询。随后,我们引入粗到细显著性排序策略,鼓励模型学习视频与层次化负查询之间的多粒度语义关系,以提升组合泛化。大量实验在两个具有挑战性的基准上验证了我们方法的有效性和通用性。我们的代码可在https://github.com/zxccade/SHINE获取。
关键词
引用
@article{arxiv.2407.05118,
title = {SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding},
author = {Zixu Cheng and Yujiang Pu and Shaogang Gong and Parisa Kordjamshidi and Yu Kong},
journal= {arXiv preprint arXiv:2407.05118},
year = {2024}
}
备注
Accepted to ECCV 2024