中文

用于视觉描述生成的语义组合网络

计算机视觉与模式识别 2017-03-30 v2 计算与语言 机器学习

摘要

我们开发了一种用于图像描述生成的语义组合网络 (SCN),其中从图像检测语义概念(即标签),并使用每个标签的概率来组合长短期记忆 (LSTM) 网络中的参数。SCN 将 LSTM 的每个权重矩阵扩展为一组依赖于标签的权重矩阵的集成。集成中每个成员用于生成图像描述的程度与相应标签的图像依赖概率相关联。除了为图像生成描述外,我们还将 SCN 扩展为视频片段生成描述。我们定性地分析了 SCN 中的语义组合,并在三个基准数据集:COCO、Flickr30k 和 Youtube2Text 上定量评估了算法。实验结果表明,所提出的方法在多个评估指标上显著优于先前最先进的方法。

关键词

引用

@article{arxiv.1611.08002,
  title  = {Semantic Compositional Networks for Visual Captioning},
  author = {Zhe Gan and Chuang Gan and Xiaodong He and Yunchen Pu and Kenneth Tran and Jianfeng Gao and Lawrence Carin and Li Deng},
  journal= {arXiv preprint arXiv:1611.08002},
  year   = {2017}
}

备注

Accepted in CVPR 2017