中文

跨视频上下文知识探索与利用用于弱监督时序动作定位中的歧义消减

计算机视觉与模式识别 2023-12-12 v2

摘要

弱监督时序动作定位(WSTAL)旨在利用视频级标签在未裁剪视频中定位动作。尽管近期有进展,现有方法主要遵循由分类定位的流水线,通常单独处理每个片段,从而仅利用了有限的上下文信息。结果,模型将缺乏对各类动作模式(如外观与时间结构)的全面理解,导致分类学习与时间定位中的歧义。我们的工作从一新视角解决此问题,通过探索并利用数据集内的跨视频上下文知识,仅借助弱标签恢复动作实例的数据集级语义结构,从而间接提升对细粒度动作模式的整体理解并缓解上述歧义。具体而言,提出了一个端到端框架,包括鲁棒记忆引导对比学习(RMGCL)模块与全局知识总结聚合(GKSA)模块。首先,RMGCL模块探索跨视频动作特征的对比与一致性,辅助学习更具结构性和紧凑性的嵌入空间,从而减少分类学习中的歧义。进一步,GKSA模块用于以可学习方式高效总结并传播跨视频代表性动作知识,以促进整体动作模式理解,进而生成高置信度伪标签用于自学习,从而缓解时间定位中的歧义。在THUMOS14、ActivityNet1.3和FineAction上的大量实验表明,我们的方法优于最先进方法,并且可轻松插入其他WSTAL方法中。

关键词

引用

@article{arxiv.2308.12609,
  title  = {Cross-Video Contextual Knowledge Exploration and Exploitation for Ambiguity Reduction in Weakly Supervised Temporal Action Localization},
  author = {Songchun Zhang and Chunhui Zhao},
  journal= {arXiv preprint arXiv:2308.12609},
  year   = {2023}
}

备注

Accepted by IEEE TCSVT. 14 pages and 7 figures