中文

测试时零样本时序动作定位

计算机视觉与模式识别 2024-04-12 v2

摘要

零样本时序动作定位(ZS-TAL)旨在识别和定位训练期间未见过的未剪辑视频中的动作。现有的 ZS-TAL 方法涉及在大量标注训练数据上微调模型。虽然有效,但基于训练的 ZS-TAL 方法假设有可用于监督学习的标注数据,这在某些应用中可能不切实际。此外,训练过程自然会将领域偏差引入学习到的模型中,这可能会对模型对任意视频的泛化能力产生不利影响。这些考虑促使我们从全新的角度处理 ZS-TAL 问题,放宽对训练数据的要求。为此,我们引入了一种执行测试时适应以进行时序动作定位的新方法(T3AL)。简而言之,T3AL 适应预训练的视觉语言模型(VLM)。T3AL 分三步运行。首先,通过聚合整个视频的信息来计算动作类别的视频级伪标签。然后,采用受自监督学习启发的新颖流程执行动作定位。最后,使用最先进的字幕模型提取的帧级文本描述来细化动作区域提议。我们通过在 THUMOS14 和 ActivityNet-v1.3 数据集上进行实验来验证 T3AL 的有效性。我们的结果表明,T3AL 显著优于基于最先进 VLM 的零样本基线,证实了测试时适应方法的益处。

关键词

引用

@article{arxiv.2404.05426,
  title  = {Test-Time Zero-Shot Temporal Action Localization},
  author = {Benedetta Liberatori and Alessandro Conti and Paolo Rota and Yiming Wang and Elisa Ricci},
  journal= {arXiv preprint arXiv:2404.05426},
  year   = {2024}
}

备注

CVPR 2024