中文

ACORT:一种用于参数高效图像字幕的紧凑对象关系 Transformer

计算机视觉与模式识别 2022-02-14 v1 计算与语言 机器学习

摘要

近期将基于 Transformer 的架构应用于图像字幕的研究利用了 Transformer 在自然语言任务上的成功,取得了最先进的图像字幕性能。遗憾的是,尽管这些模型表现良好,其一大缺陷在于模型规模庞大。为此,我们提出三种用于图像字幕 Transformer 的参数缩减方法:基数编码(Radix Encoding)、跨层参数共享与注意力参数共享。通过结合这些方法,我们提出的 ACORT 模型参数量较基线模型减少 3.7 至 21.6 倍,且不损害测试性能。在 MS-COCO 数据集上的结果表明,我们的 ACORT 模型可与基线和 SOTA 方法竞争,CIDEr 分数 >=126。最后,我们给出定性结果与消融实验,进一步证明所提改进的有效性。代码与预训练模型已公开于 https://github.com/jiahuei/sparse-image-captioning。

关键词

引用

@article{arxiv.2202.05451,
  title  = {ACORT: A Compact Object Relation Transformer for Parameter Efficient Image Captioning},
  author = {Jia Huei Tan and Ying Hua Tan and Chee Seng Chan and Joon Huang Chuah},
  journal= {arXiv preprint arXiv:2202.05451},
  year   = {2022}
}

备注

Neurocomputing; In Press