基于期望最大化多示例学习的弱监督动作定位
计算机视觉与模式识别
2020-12-23 v2 机器学习
机器学习
摘要
弱监督动作定位需要训练一个模型,在仅给定视频级动作标签的情况下定位视频中的动作片段。它可在多示例学习(MIL)框架下求解,其中一个包(视频)包含多个示例(动作片段)。由于仅知道包的标签,主要挑战是分配包内哪些关键示例触发了包的标签。大多数先前模型使用基于注意力的方法,对示例施加注意力以生成包的表征,然后通过包的分类进行训练。然而,这些模型隐式地违背了MIL假设,即负包中的示例应一致为负。在本工作中,我们显式地将关键示例分配建模为隐变量,并采用期望最大化(EM)框架。我们推导了两种伪标签生成方案来建模E和M过程,并迭代优化似然下界。我们表明,我们的EM-MIL方法更准确地建模了学习目标和MIL假设。它在两个标准基准THUMOS14和ActivityNet1.2上取得了最先进的性能。
引用
@article{arxiv.2004.00163,
title = {Weakly-Supervised Action Localization with Expectation-Maximization Multi-Instance Learning},
author = {Zhekun Luo and Devin Guillory and Baifeng Shi and Wei Ke and Fang Wan and Trevor Darrell and Huijuan Xu},
journal= {arXiv preprint arXiv:2004.00163},
year = {2020}
}
备注
Accepted at European Conference on Computer Vision (ECCV), 2020