视觉描述的预言机性能
计算机视觉与模式识别
2016-09-15 v5 计算与语言
机器学习
摘要
近年来,将图像和视频与自然语言描述相关联的任务引起了极大关注。在开发新算法和发布新数据集方面取得了快速进展。事实上,在一些标准数据集上,最先进的结果已被推至越来越难以取得显著改进的境地。本工作不提出新模型,而是研究在各种视觉描述数据集上,无需额外数据标注工作或人工评估,凭经验建立性能上界的可能性。特别地,假设视觉描述被分解为两步:从视觉输入到视觉概念,以及从视觉概念到自然语言描述。当假设第一步完美且只需为第二步训练一个条件语言模型时,便能够获得一个上界。我们在 MS-COCO、YouTube2Text 和 LSMDC(M-VAD 与 MPII-MD 的组合)上展示了此类边界的构建。令人惊讶的是,尽管我们在第一步中使用的视觉概念提取过程不完美,且第二步的语言模型简单,我们表明当前最先进的模型与学到的上界相比仍有差距。此外,借助这样的边界,我们量化了有关图像和视频描述的几个重要因素:不同模型捕获的视觉概念数量、捕获的视觉元素数量与其准确性之间的权衡,以及不同数据集的内在难度与优势。
引用
@article{arxiv.1511.04590,
title = {Oracle performance for visual captioning},
author = {Li Yao and Nicolas Ballas and Kyunghyun Cho and John R. Smith and Yoshua Bengio},
journal= {arXiv preprint arXiv:1511.04590},
year = {2016}
}
备注
BMVC2016 (Oral paper)