基于候选片段的多示例学习用于弱监督时序动作定位
计算机视觉与模式识别
2023-05-30 v1
摘要
弱监督时序动作定位旨在仅使用视频级类别标签训练,在未裁剪视频中定位并识别动作。在无实例级标注的情况下,多数现有方法遵循基于片段的多示例学习(S-MIL)框架,其中片段的预测由视频标签监督。然而,训练阶段获取片段级分数的目标与测试阶段获取候选片段级分数的目标不一致,导致次优结果。为解决此问题,我们提出一种新颖的基于候选片段的多示例学习(P-MIL)框架,在训练与测试阶段直接对候选片段进行分类,其包含三项关键设计:1)周边对比特征提取模块,通过考虑周边对比信息抑制具判别性的短候选片段;2)候选片段完整性评估模块,在完整性伪标签指导下抑制低质量候选片段;3)实例级排序一致性损失,利用 RGB 与 FLOW 模态的互补性实现鲁棒检测。在 THUMOS14 与 ActivityNet 两个具挑战性基准上的大量实验结果表明了本方法的优越性能。
引用
@article{arxiv.2305.17861,
title = {Proposal-Based Multiple Instance Learning for Weakly-Supervised Temporal Action Localization},
author = {Huan Ren and Wenfei Yang and Tianzhu Zhang and Yongdong Zhang},
journal= {arXiv preprint arXiv:2305.17861},
year = {2023}
}
备注
Accepted by CVPR 2023. Code is available at https://github.com/RenHuan1999/CVPR2023_P-MIL