Transformer 与带注意力机制的 LSTM 网络在图像描述上的比较研究
计算机视觉与模式识别
2023-03-07 v1 机器学习
摘要
在当下生成式智能的全球化世界中,大多数体力劳动任务已实现自动化并提升了效率。这可帮助企业节省时间与成本。生成式智能的一个关键组成部分是视觉与语言的融合。因此,图像描述成为一个引人关注的研究领域。研究者已尝试用不同深度学习架构解决该问题,尽管准确率有所提升,但结果仍不尽如人意。本研究着力比较 Transformer 与带注意力块的 LSTM 模型在 MS-COCO 数据集(图像描述的标准数据集)上的表现。两种模型均使用预训练的 Inception-V3 CNN 编码器提取图像特征。采用双语评估替补得分(BLEU)检验两模型生成描述的正确性。除 Transformer 和带注意力块的 LSTM 模型外,还讨论了 CLIP-diffusion 模型、M2-Transformer 模型和 X-Linear Attention 模型及其最先进(SOTA)准确率。
引用
@article{arxiv.2303.02648,
title = {Comparative study of Transformer and LSTM Network with attention mechanism on Image Captioning},
author = {Pranav Dandwate and Chaitanya Shahane and Vandana Jagtap and Shridevi C. Karande},
journal= {arXiv preprint arXiv:2303.02648},
year = {2023}
}
备注
13 pages, 7 figures, 2 tables