中文

视觉描述的预言机性能

计算机视觉与模式识别 2016-09-15 v5 计算与语言 机器学习

摘要

近年来,将图像和视频与自然语言描述相关联的任务引起了极大关注。在开发新算法和发布新数据集方面取得了快速进展。事实上,在一些标准数据集上,最先进的结果已被推至越来越难以取得显著改进的境地。本工作不提出新模型,而是研究在各种视觉描述数据集上,无需额外数据标注工作或人工评估,凭经验建立性能上界的可能性。特别地,假设视觉描述被分解为两步:从视觉输入到视觉概念,以及从视觉概念到自然语言描述。当假设第一步完美且只需为第二步训练一个条件语言模型时,便能够获得一个上界。我们在 MS-COCO、YouTube2Text 和 LSMDC(M-VAD 与 MPII-MD 的组合)上展示了此类边界的构建。令人惊讶的是,尽管我们在第一步中使用的视觉概念提取过程不完美,且第二步的语言模型简单,我们表明当前最先进的模型与学到的上界相比仍有差距。此外,借助这样的边界,我们量化了有关图像和视频描述的几个重要因素:不同模型捕获的视觉概念数量、捕获的视觉元素数量与其准确性之间的权衡,以及不同数据集的内在难度与优势。

关键词

引用

@article{arxiv.1511.04590,
  title  = {Oracle performance for visual captioning},
  author = {Li Yao and Nicolas Ballas and Kyunghyun Cho and John R. Smith and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1511.04590},
  year   = {2016}
}

备注

BMVC2016 (Oral paper)