面向视频字幕生成、检索与问答的端到端概念词检测
计算机视觉与模式识别
2017-07-26 v3
摘要
我们提出了一种高层概念词检测器,它可以与任何视频到语言模型集成。它以视频为输入,生成一个概念词列表,作为语言生成模型有用的语义先验。所提出的词检测器具有两个重要特性。首先,它不需要任何外部知识源进行训练。其次,所提出的词检测器可以以端到端的方式与任何视频到语言模型联合训练。为了最大化检测到的词的价值,我们还开发了一种语义注意力机制,该机制选择性地关注检测到的概念词,并将它们与语言模型中的词编码和解码相融合。为了证明所提出的方法确实提高了多个视频到语言任务的性能,我们参加了 LSMDC 2016 的四项任务。我们的方法在其中三项任务中取得了最佳准确率,包括填空、多项选择测试和电影检索。我们在另一项任务(电影描述)中也取得了可比的性能。
引用
@article{arxiv.1610.02947,
title = {End-to-end Concept Word Detection for Video Captioning, Retrieval, and Question Answering},
author = {Youngjae Yu and Hyungjin Ko and Jongwook Choi and Gunhee Kim},
journal= {arXiv preprint arXiv:1610.02947},
year = {2017}
}
备注
In CVPR 2017. Winner of three (fill-in-the-blank, multiple-choice test, and movie retrieval) out of four tasks of the LSMDC 2016 Challenge. 22 pages