重访弱监督时序动作定位中的前景与背景分离:一种基于聚类的方法
计算机视觉与模式识别
2023-12-22 v1
摘要
弱监督时序动作定位旨在仅利用视频级动作标签来定位视频中的动作实例。现有方法主要采用“通过分类进行定位”的流程,利用视频分类损失优化片段级预测。然而,这种公式化存在分类与检测之间的差异,导致前景和背景 (F&B) 片段分离不准确。为缓解这一问题,我们提议通过无监督片段聚类来探索片段间的潜在结构,而不是严重依赖视频分类损失。具体而言,我们提出了一种新颖的基于聚类的 F&B 分离算法。它包含两个核心组件:一个将片段分组到多个潜在簇中的片段聚类组件,以及一个进一步将簇分类为前景或背景的簇分类组件。由于没有真实标签来训练这两个组件,我们引入了一种基于最优传输的统一自标记机制,以生成匹配几种合理先验分布的高质量伪标签。这确保了片段的簇分配能够准确地与其 F&B 标签相关联,从而提升 F&B 分离效果。我们在三个基准数据集上评估了我们的方法:THUMOS14、ActivityNet v1.2 和 v1.3。我们的方法在所有三个基准数据集上均取得了令人瞩目的性能,同时比以前的方法显著更轻量。代码地址:https://github.com/Qinying-Liu/CASE。
引用
@article{arxiv.2312.14138,
title = {Revisiting Foreground and Background Separation in Weakly-supervised Temporal Action Localization: A Clustering-based Approach},
author = {Qinying Liu and Zilei Wang and Shenghai Rong and Junjie Li and Yixin Zhang},
journal= {arXiv preprint arXiv:2312.14138},
year = {2023}
}
备注
ICCV2023