中文

卷积图像描述生成

计算机视觉与模式识别 2017-11-28 v1

摘要

图像描述生成是一项重要但具挑战性的任务,可应用于虚拟助手、编辑工具、图像索引以及残障辅助。其挑战源于可能图像描述的多样性和歧义性。近年来,借助由长短期记忆(LSTM)单元驱动循环神经网络,图像描述生成取得了显著进展。尽管 LSTM 单元缓解了梯度消失问题,且具备记忆依赖关系的突出能力,但其结构复杂且本质上跨时间顺序执行。为解决此问题,近期工作展示了卷积网络在机器翻译与条件图像生成中的益处。受其成功启发,本文我们提出了一种卷积图像描述生成技术。我们在具挑战性的 MSCOCO 数据集上展示了其效力,并表现出与基线相当的性能,同时按参数量计的训练时间更快。我们还进行了详细分析,给出了支持卷积语言生成方法的充分理由。

关键词

引用

@article{arxiv.1711.09151,
  title  = {Convolutional Image Captioning},
  author = {Jyoti Aneja and Aditya Deshpande and Alexander Schwing},
  journal= {arXiv preprint arXiv:1711.09151},
  year   = {2017}
}

备注

11 pages, 9 Figures