悲剧加时间:从弱标注视频中捕捉非意图人类活动
计算机视觉与模式识别
2022-04-29 v1
摘要
在包含非意图执行动作的视频中,行为主体并未达成其预期目标。在此类视频中,计算机视觉系统难以理解目标导向行为等高层概念,而人类自幼年起便具备这种能力。在人工智能体中灌输该能力,可使其在社会学习中表现更佳,因为它们能借助目的论视角评估人类行为。为验证深度学习模型执行此任务的能力,我们基于 Oops 数据集 [15] 构建了 W-Oops 数据集。W-Oops 包含 2100 段非意图人类动作视频,通过人工标注收集了 44 个目标导向和 30 个非意图的视频级活动标签。鉴于片段标注过程代价高昂,我们提出一种弱监督算法,仅利用视频级标签来定位视频中目标导向与非意图的时间区域。具体而言,我们采用基于注意力机制的策略,预测对分类任务贡献最大的时间区域。同时,我们设计的重叠正则化使模型聚焦于视频的不同部分以推断目标导向与非意图活动,并保证其时间顺序。大量定量实验验证了我们的定位方法的有效性。我们进一步开展了视频字幕实验,表明所提出的定位模块确实有助于目的论动作理解。
引用
@article{arxiv.2204.13548,
title = {Tragedy Plus Time: Capturing Unintended Human Activities from Weakly-labeled Videos},
author = {Arnav Chakravarthy and Zhiyuan Fang and Yezhou Yang},
journal= {arXiv preprint arXiv:2204.13548},
year = {2022}
}