中文

范式转变:视频中时序句子 grounding 的全端到端训练

计算机视觉与模式识别 2026-04-06 v1 人工智能

摘要

视频时序句子 grounding(TSGV)旨在从未剪辑的视频中定位与句子查询在语义上对应的时序片段。当前大多数方法采用预训练的查询不可知视觉编码器进行离线特征提取,视频主干网络被冻结且未针对TSGV进行优化。这导致视频主干为视觉分类训练而设计,但用于TSGV时存在任务差异问题。为弥合这一差距,我们提出了全端到端范式,联合优化视频主干和localization头。我们首先进行实证研究,验证在不同模型规模下端到端学习相对于冻结基线的有效性。进一步地,我们引入了句子条件适配器(SCADA),利用句子特征在训练时自适应地训练视频主干的少数参数。SCADA促进了更深层网络主干的部署,同时显著增强了视觉表征,通过精确整合语言嵌入来调制特征图。实验表明,在两个基准数据集上,我们的方法优于最先进的方法。代码和模型将公开 release。

关键词

引用

@article{arxiv.2604.02860,
  title  = {A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos},
  author = {Allen He and Qi Liu and Kun Liu and Xinchen Liu and Wu Liu},
  journal= {arXiv preprint arXiv:2604.02860},
  year   = {2026}
}

备注

Accepted as CVPR 2026 Workshop PVUW