无训练零样时序动作检测:利用视觉语言模型
计算机视觉与模式识别
2026-05-19 v1
摘要
现有的零样时序动作检测(ZSTAD)方法主要使用全监督或无监督策略来识别未知活动。然而,这些基于训练的方法容易受域迁移影响,计算成本高,限制了其在实际场景中的实际应用性。本文不同于以往工作,我们提出一种训练-free 零样时序动作检测(FreeZAD)方法,利用现有的视觉语言(ViL)模型直接对未剪辑视频中的未知活动进行分类和定位,而无需任何额外的微调或适应。我们通过设计对数衰减加权的外内对比得分(LogOIC)和基于频率的动作性校准,来缓解对显式时序建模和依赖伪标签质量的需求。此外,我们引入一种基于原型中心抽样(PCS)的测试时间适应(TTA)策略,以扩展 FreeZAD,使 ViL 模型能够更有效地适用于 ZSTAD。广泛的实验在 THUMOS14 和 ActivityNet-1.3 数据集上表明,所提出的训练-free 方法在仅需 1/13 的运行时间的情况下,超过了最先进的无监督方法。当配备 TTA 时,增强方法进一步缩小了与全监督方法的差距。
引用
@article{arxiv.2501.13795,
title = {Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models},
author = {Chaolei Han and Hongsong Wang and Jidong Kuang and Lei Zhang and Jie Gui},
journal= {arXiv preprint arXiv:2501.13795},
year = {2026}
}