基于端到端注意力的图像字幕生成
计算机视觉与模式识别
2021-05-03 v1 人工智能
摘要
本文针对分子翻译中的图像字幕问题,即给定分子结构预测InChI格式的化学符号。当前方法主要遵循基于规则或CNN+RNN的方法。然而,它们在含噪图像和具有少量可区分特征的图像上表现不佳。为克服此问题,我们提出了一种端到端Transformer模型。与基于注意力的技术相比,我们所提模型在分子数据集上表现更优。
引用
@article{arxiv.2104.14721,
title = {End-to-End Attention-based Image Captioning},
author = {Carola Sundaramoorthy and Lin Ziwen Kelvin and Mahak Sarin and Shubham Gupta},
journal= {arXiv preprint arXiv:2104.14721},
year = {2021}
}