正在烹饪什么?利用文本、语音和视觉解读烹饪视频
计算与语言
2015-03-16 v3 计算机视觉与模式识别
信息检索
摘要
我们提出了一种将指令序列与某人执行任务的视频进行对齐的新方法。具体而言,我们专注于烹饪领域,其中指令对应于食谱。我们的技术依赖于隐马尔可夫模型(HMM)将食谱步骤与(自动生成的)语音转录文本进行对齐。随后,我们利用基于深度卷积神经网络的先进视觉食物检测器对该对齐进行优化。我们表明,我们的技术优于基于关键词定位的简单技术。它还支持有趣的应用,例如用关键帧自动为食谱配图,以及在视频中搜索感兴趣的事件。
引用
@article{arxiv.1503.01558,
title = {What's Cookin'? Interpreting Cooking Videos using Text, Speech and Vision},
author = {Jonathan Malmaud and Jonathan Huang and Vivek Rathod and Nick Johnston and Andrew Rabinovich and Kevin Murphy},
journal= {arXiv preprint arXiv:1503.01558},
year = {2015}
}
备注
To appear in NAACL 2015