Multi-Moments in Time:用于多动作视频理解的学习与模型解释
计算机视觉与模式识别
2021-09-29 v4 机器学习
图像与视频处理
摘要
视频捕捉的事件通常包含多个顺序性和同时性的动作,即便在仅仅几秒的时间跨度内也是如此。然而,大多数用于训练视频动作识别模型的大规模数据集每个视频仅提供单一标签。因此,模型可能因分类出视频中存在但未被显式标注的动作而受到错误惩罚,并且无法学习到训练中各视频所呈现的全部信息谱。为此,我们提出 Multi-Moments in Time 数据集(M-MiT),该数据集包含超过一百万段三秒视频上的逾两百万个动作标签。这一多标签数据集在如何训练和分析多动作检测模型方面带来了新的挑战。在此,我们给出使用针对长尾多标签学习调整的损失函数进行多动作识别的基线结果,提供用于可视化和解释多标签动作检测训练模型的改进方法,并展示了将在 M-MiT 上训练的模型迁移到较小数据集上的优势。
引用
@article{arxiv.1911.00232,
title = {Multi-Moments in Time: Learning and Interpreting Models for Multi-Action Video Understanding},
author = {Mathew Monfort and Bowen Pan and Kandan Ramakrishnan and Alex Andonian and Barry A McNamara and Alex Lascelles and Quanfu Fan and Dan Gutfreund and Rogerio Feris and Aude Oliva},
journal= {arXiv preprint arXiv:1911.00232},
year = {2021}
}