中文

基于多重Transformer自注意力机制的图像描述生成

计算机视觉与模式识别 2021-03-10 v1 人工智能 计算与语言

摘要

兼具充分精度的实时图像描述生成是该研究领域的主要挑战。本文工作“用于自注意力机制的多重Transformer(MTSM)”利用多个 transformer 解决这些问题。所提算法 MTSM 使用 transformer 检测器(DETR)获取区域提议。随后,MTSM 将这些区域提议及其视觉与几何特征传入另一个 transformer,从而实现自注意力机制,并学习物体的局部与全局关联。所提算法 MTSM 的定性与定量结果在 MSCOCO 数据集上展示。

关键词

引用

@article{arxiv.2103.05103,
  title  = {Image Captioning using Multiple Transformers for Self-Attention Mechanism},
  author = {Farrukh Olimov and Shikha Dubey and Labina Shrestha and Tran Trung Tin and Moongu Jeon},
  journal= {arXiv preprint arXiv:2103.05103},
  year   = {2021}
}