由音频解说引导的弱监督动作检测
计算机视觉与模式识别
2022-05-13 v1
摘要
相比图像,视频是组织更良好、经过筛选的视觉概念学习数据源。与仅涉及空间信息的二维图像不同,额外的时间维度桥接并同步了多种模态。然而,在大多数视频检测基准中,这些额外模态未被充分利用。例如,EPIC Kitchens 是第一人称(自我中心)视觉中最大的数据集,但它仍依赖众包信息来细化动作边界以提供实例级动作标注。我们探索了如何消除视频检测数据中提供细化边界的昂贵标注。我们提出一个模型,从解说监督中学习并利用多模态特征,包括 RGB、运动流和环境声音。我们的模型学习关注与解说标签相关的帧,同时抑制无关帧被使用。我们的实验表明,嘈杂的音频解说足以学习一个良好的动作检测模型,从而降低标注开销。
引用
@article{arxiv.2205.05895,
title = {Weakly-Supervised Action Detection Guided by Audio Narration},
author = {Keren Ye and Adriana Kovashka},
journal= {arXiv preprint arXiv:2205.05895},
year = {2022}
}
备注
To appear, in Joint 1st Ego4D and 10th EPIC Workshop, held in conjunction with the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)