ClipTBP:基于片段对的时序边界预测与边界感知学习用于视频片段检索
计算机视觉与模式识别
2026-05-01 v1 人工智能
摘要
视频片段检索是根据给定文本查询检索视频中特定片段的任务。近期研究致力于通过片段级视觉-语言相似性学习以及基于 Transformer 的时序边界回归来提升多模态对齐性能。然而,现有模型在计算相似度时未考虑与查询匹配的多个答案片段之间的关系。因此,现有模型容易受到周围上下文中视觉相似片段的影响。现有模型在片段级别计算相似度,忽略了与单个查询对应的多个答案片段之间的关系。因此,它们难以排除与查询无关的片段。为解决这些问题,我们提出 ClipTBP,一个基于边界感知学习的片段对时序边界预测框架。ClipTBP 引入片段级对齐损失,以显式学习答案片段之间的语义关系。ClipTBP 还通过同时应用主边界损失和辅助边界损失来预测精确的时序边界。当应用于各种现有模型时,ClipTBP 持续提升性能,即使在模糊查询场景下也展现出更鲁棒的边界预测性能。
引用
@article{arxiv.2604.27591,
title = {ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval},
author = {Ji-Hyeon Kim and Ho-Joong Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2604.27591},
year = {2026}
}
备注
15 pages