学习将细粒度动作定位并对齐到稀疏指令
计算机视觉与模式识别
2018-09-25 v1
摘要
自动生成与视频内容时间对齐的文本视频描述,是计算机视觉领域长期以来的目标。该任务具有挑战性,原因在于难以弥合视觉与自然语言领域之间的语义鸿沟。本文解决的是自动生成一组指令与展示某项活动的第一人称视频之间对齐关系的任务。书面指令的稀疏描述与歧义性带来了显著的对齐挑战。我们方法的关键在于利用自我中心线索生成简洁的动作提议集,随后通过物体识别与计算语言学技术将其与菜谱步骤进行匹配。我们在 Extended GTEA Gaze+ 数据集与 Bristol Egocentric Object Interactions Dataset 上均取得了有前景的结果。
引用
@article{arxiv.1809.08381,
title = {Learning to Localize and Align Fine-Grained Actions to Sparse Instructions},
author = {Meera Hahn and Nataniel Ruiz and Jean-Baptiste Alayrac and Ivan Laptev and James M. Rehg},
journal= {arXiv preprint arXiv:1809.08381},
year = {2018}
}