动作修饰词:从教学视频中的副词学习
计算机视觉与模式识别
2020-03-25 v3
摘要
我们提出了一种利用伴随旁白中的弱监督从教学视频中学习副词表示的方法。我们方法的关键在于,副词的视觉表示高度依赖于其所修饰的动作,尽管同一副词会以相似方式修饰多个动作。例如,虽然“快速涂抹”和“快速混合”看起来不同,但我们可以学习一种公共表示,使我们能够在其他动作中识别二者。我们将此表述为一个嵌入问题,并使用缩放点积注意力(scaled dot-product attention)从弱监督的视频旁白中学习。我们将副词联合学习为在嵌入空间上操作的可逆变换,以添加或移除副词的效果。由于此前没有从副词进行弱监督学习的相关工作,我们从 HowTo100M 数据集的一个子集中收集了 6 个副词的成对动作-副词标注:quickly/slowly、finely/coarsely 和 partially/completely。我们的方法在视频到副词检索任务上以 0.719 mAP 的性能优于所有基线。我们还展示了我们的模型能够关注相关视频部分以确定给定动作的副词。
引用
@article{arxiv.1912.06617,
title = {Action Modifiers: Learning from Adverbs in Instructional Videos},
author = {Hazel Doughty and Ivan Laptev and Walterio Mayol-Cuevas and Dima Damen},
journal= {arXiv preprint arXiv:1912.06617},
year = {2020}
}
备注
CVPR 2020