中文

基于端到端注意力的图像字幕生成

计算机视觉与模式识别 2021-05-03 v1 人工智能

摘要

本文针对分子翻译中的图像字幕问题,即给定分子结构预测InChI格式的化学符号。当前方法主要遵循基于规则或CNN+RNN的方法。然而,它们在含噪图像和具有少量可区分特征的图像上表现不佳。为克服此问题,我们提出了一种端到端Transformer模型。与基于注意力的技术相比,我们所提模型在分子数据集上表现更优。

关键词

引用

@article{arxiv.2104.14721,
  title  = {End-to-End Attention-based Image Captioning},
  author = {Carola Sundaramoorthy and Lin Ziwen Kelvin and Mahak Sarin and Shubham Gupta},
  journal= {arXiv preprint arXiv:2104.14721},
  year   = {2021}
}