基于多重Transformer自注意力机制的图像描述生成
计算机视觉与模式识别
2021-03-10 v1 人工智能
计算与语言
摘要
兼具充分精度的实时图像描述生成是该研究领域的主要挑战。本文工作“用于自注意力机制的多重Transformer(MTSM)”利用多个 transformer 解决这些问题。所提算法 MTSM 使用 transformer 检测器(DETR)获取区域提议。随后,MTSM 将这些区域提议及其视觉与几何特征传入另一个 transformer,从而实现自注意力机制,并学习物体的局部与全局关联。所提算法 MTSM 的定性与定量结果在 MSCOCO 数据集上展示。
引用
@article{arxiv.2103.05103,
title = {Image Captioning using Multiple Transformers for Self-Attention Mechanism},
author = {Farrukh Olimov and Shikha Dubey and Labina Shrestha and Tran Trung Tin and Moongu Jeon},
journal= {arXiv preprint arXiv:2103.05103},
year = {2021}
}