由描述引导的自顶向下视觉显著性
计算机视觉与模式识别
2017-09-12 v2
摘要
神经图像/视频描述模型能够生成准确的描述,但其将区域映射到词的内部过程是一个黑箱,因此难以解释。自顶向下的神经显著性方法可以在给定高级语义任务(如物体分类)时找到重要区域,但无法使用自然语言句子作为该任务的自顶向下输入。本文提出描述引导的视觉显著性(Caption-Guided Visual Saliency),以揭示现代编码器-解码器网络中的区域到词的映射,并证明该映射是从描述训练数据中隐式学习到的,无需任何像素级标注。我们的方法能够为预测的描述以及任意查询句子生成空间或时空热力图。它在无需引入显式注意力层开销的情况下恢复显著性,并可用于分析多种现有模型架构并改进其设计。在大规模视频和图像数据集上的评估表明,我们的方法在取得与现有方法相当的描述性能的同时,提供了更准确的显著性热力图。我们的代码发布于 visionlearninggroup.github.io/caption-guided-saliency/。
引用
@article{arxiv.1612.07360,
title = {Top-down Visual Saliency Guided by Captions},
author = {Vasili Ramanishka and Abir Das and Jianming Zhang and Kate Saenko},
journal= {arXiv preprint arXiv:1612.07360},
year = {2017}
}
备注
CVPR 2017 camera ready version