中文

面向视觉条件长文本序列生成的稀疏图到序列学习

计算机视觉与模式识别 2020-07-14 v1 计算与语言 机器学习

摘要

在视觉信息条件下生成更长的文本序列是一个值得探索的有趣问题。与标准的视觉条件句子级生成(例如图像或视频描述)相比,此处的挑战有所增加,因为其需要生成一段简明且连贯的故事来描述视觉内容。在本文中,我们将此视觉到序列(Vision-to-Sequence)问题建模为图到序列(Graph-to-Sequence)学习问题,并采用 Transformer 架构进行处理。具体而言,我们引入了稀疏图到序列 Transformer(SGST),用于对图进行编码并解码出序列。编码器旨在直接编码图级语义,而解码器用于生成更长的序列。在基准图像段落数据集上进行的实验表明,与先前最先进的方法相比,我们提出的方法在 CIDEr 评估指标上取得了 13.3% 的提升。

关键词

引用

@article{arxiv.2007.06077,
  title  = {Sparse Graph to Sequence Learning for Vision Conditioned Long Textual Sequence Generation},
  author = {Aditya Mogadala and Marius Mosbach and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2007.06077},
  year   = {2020}
}

备注

International Conference on Machine Learning (ICML) 2020 Workshop (https://logicalreasoninggnn.github.io/)