基于自然语言的电影理解语言-视觉嵌入学习
计算机视觉与模式识别
2016-09-27 v1
摘要
学习联合语言-视觉嵌入具有许多极具吸引力的特性,并可用于多种实际应用,包括自然语言图像/视频标注与搜索。在本工作中,我们研究了三种不同的联合语言-视觉神经网络模型架构。我们在大规模 LSMDC16 电影数据集上针对两项任务评估了我们的模型:1) 用于视频标注与检索的标准排序;2) 我们提出的电影多选测试。该测试有助于基于人类活动的自然语言视频标注对视觉-语言模型进行自动评估。除了作为 LSMDC16 一部分提供的原始音频描述(AD)字幕外,我们还收集并将发布:a) 使用 Amazon MTurk 获得的这些字幕的人工改写;b) 基于 Knowlywood(一个活动知识挖掘模型)自动生成的“谓词+宾语”(PO)短语形式的人类活动元素。我们表现最佳的模型在 1000 个样本的子集上,标注任务的 Recall@10 达到了 19.2%,视频检索任务达到了 18.9%。对于多选测试,我们表现最佳的模型在整个 LSMDC16 公开测试集上的准确率达到了 58.11%。
引用
@article{arxiv.1609.08124,
title = {Learning Language-Visual Embedding for Movie Understanding with Natural-Language},
author = {Atousa Torabi and Niket Tandon and Leonid Sigal},
journal= {arXiv preprint arXiv:1609.08124},
year = {2016}
}
备注
13 pages