通过文本引导的零样时序动作定位
计算机视觉与模式识别
2026-05-22 v1
摘要
零样时序动作定位(ZS-TAL)涉及对未剪辑视频中的动作进行分类和定位,其中动作类别在训练时未出现。现有方法使用视觉和语言模型(VLM),利用其强大的零样迁移能力。然而,这些模型在细粒度动作分类方面面临明显挑战,难以直接用于区分动作的存在与不存在。大多数当前方法通过在大规模视频数据集上训练来解决这些挑战,这需要标注数据,往往导致泛化性能有限。最近出现的无需使用标注数据的方法作为一种替代方案。跟随这一思路,我们提出了一种新方法,“利用文本引导对视频中动作进行更精细定位”(TEGU),通过利用从大型语言模型中提炼的丰富文本信息和来自标题的结构化文本来弥补训练数据缺乏监督的不足。这种额外的语言上下文可以通过提供关于视频中细粒度动作差异的丰富线索来提高细粒度判别能力。我们通过在 THUMOS14 和 ActivityNet-v1.3 数据集上进行实验来验证所提出方法的有效性。我们的结果表明,通过利用丰富的文本信息 improved action localization,TEGU 在不涉及训练的 ZS-TAL 方法中取得了 state-of-the-art 的性能。
引用
@article{arxiv.2605.22201,
title = {Zero-Shot Temporal Action Localization Through Textual Guidance},
author = {Benedetta Liberatori and Alessandro Conti and Lorenzo Vaquero and Paolo Rota and Yiming Wang and Elisa Ricci},
journal= {arXiv preprint arXiv:2605.22201},
year = {2026}
}
备注
Accepted to FG 2026