面向弱监督时序动作定位的概率视觉语言表示
计算机视觉与模式识别
2024-08-13 v1
摘要
弱监督时序动作定位(WTAL)旨在仅使用视频级别标注检测未裁剪视频中的动作实例。由于许多现有工作基于动作分类标签进行优化,他们遇到了任务差异问题(即按分类进行定位)。为解决这一问题,近期研究尝试通过视觉语言预训练(VLP)利用动作类别名称作为辅助语义知识。然而,现有研究仍有不足之处。以往方法主要关注利用语言模型的文本信息,但忽略了动态人类动作与VLP知识在联合空间中的对齐。此外,现有方法采用确定性表示,难以捕捉细粒度的人类动作。为解决这些问题,我们提出一种新框架,在概率嵌入空间中对齐人类动作知识与VLP知识。此外,我们提出了基于统计相似性的 intra- 和 inter-distribution 对比学习,以增强概率嵌入空间。大量实验和消融研究表明,我们的方法显著优于所有之前的最先进方法。代码已公开:https://github.com/sejong-rcv/PVLR。
引用
@article{arxiv.2408.05955,
title = {Probabilistic Vision-Language Representation for Weakly Supervised Temporal Action Localization},
author = {Geuntaek Lim and Hyunwoo Kim and Joonsoo Kim and Yukyung Choi},
journal= {arXiv preprint arXiv:2408.05955},
year = {2024}
}
备注
Accepted to ACM MM 2024