中文

变分 Transformer:一种超越图像描述中准确性与多样性权衡的框架

计算机视觉与模式识别 2022-09-22 v2 机器学习

摘要

准确性和多样性是生成自然且语义正确描述的两个基本可度量表现。许多工作致力于增强其中之一,却因权衡差距导致另一者衰退。在本文中,我们将表明,源于人类标注(留一法)的较低准确性标准并不适用于机器生成的描述。为了在保持稳健准确性性能的同时提升多样性,我们提出了一种新颖的变分 Transformer(Variational Transformer)框架。通过引入“不可见信息先验”和“可自动选择的 GMM”,我们指导编码器在不同场景中学习精确的语言信息和对象关系以保证准确性。通过引入“范围-中位数奖励”基线,我们在基于强化学习的训练过程中保留具有更高奖励的更多样化候选以保证多样性。实验表明,我们的方法实现了准确性(CIDEr)和多样性(self-CIDEr)的同步提升,分别提高 1.1% 和 4.8%。此外,在语义检索方面,我们的方法与人类标注性能最为接近,R@1(i2t) 达到 50.3(人类为 50.6)。

关键词

引用

@article{arxiv.2205.14458,
  title  = {Variational Transformer: A Framework Beyond the Trade-off between Accuracy and Diversity for Image Captioning},
  author = {Longzhen Yang and Yihang Liu and Yitao Peng and Lianghua He},
  journal= {arXiv preprint arXiv:2205.14458},
  year   = {2022}
}