中文

通过对抗式传播标注数据实现半监督图像描述生成

计算机视觉与模式识别 2023-01-27 v1 人工智能 计算与语言 机器学习

摘要

我们提出了一种新颖的数据高效半监督框架,以改善图像描述生成模型的泛化能力。构建大规模标注图像描述数据集在人力、时间和成本方面是一项昂贵的任务。与手动标注所有训练样本不同,单独收集单模态数据集要容易得多,例如大规模图像数据集和句子数据集。我们利用此类大规模未配对图像和描述数据,在标准配对数据之上通过学习将它们关联起来。为此,我们提出的半监督学习方法以对抗学习的方式为未配对样本分配伪标签,从而学习图像与描述之间的联合分布。我们的方法训练一个描述生成器从配对数据中学习,并逐步关联未配对数据。即使在具有挑战性的场景下,包括任务外数据(即关系描述生成,其中目标任务与未配对数据不同)和网络爬取数据,该方法也显示出显著的性能提升。我们还表明,我们提出的方法在理论上有充分动机,并具有有利的全局最优性质。我们在(1)基于图像和(2)基于密集区域的描述生成数据集上的广泛而全面的实证结果,以及对极少配对COCO数据集的深入分析,证明了我们的半监督学习方法结合未配对数据相较于对比方法的一致有效性。

关键词

引用

@article{arxiv.2301.11174,
  title  = {Semi-Supervised Image Captioning by Adversarially Propagating Labeled Data},
  author = {Dong-Jin Kim and Tae-Hyun Oh and Jinsoo Choi and In So Kweon},
  journal= {arXiv preprint arXiv:2301.11174},
  year   = {2023}
}

备注

Journal extension of our EMNLP 2019 paper (arXiv:1909.02201)