中文

基于判别性微调的跨域图像描述生成

计算机视觉与模式识别 2023-04-05 v1 人工智能 计算与语言

摘要

神经描述生成器通常训练为模仿人工生成的参考描述,而不针对任何特定交流目标进行优化,从而导致生成模糊描述等问题。在本文中,我们表明,使用自监督判别性交流目标对开箱即用的神经描述生成器进行微调,有助于恢复一种更直白、更具视觉描述性且对图像内容信息量更大的语言。给定目标图像,系统必须学习生成一种描述,使得开箱即用的文本条件图像检索器能够在候选集合中识别出该图像。我们使用流行的 ClipCap 描述生成器进行实验,并使用 BLIP 复现了主要结果。在与非微调模型相同的描述数据集上训练和测试时,就与真实人工描述的相似度而言,判别性微调涌现出的描述略落后于非微调模型生成的那些描述。然而,当模型不经进一步调优而用于为域外数据集生成描述时,我们的判别性微调描述生成器生成的描述比未经微调的同一描述生成器生成的描述更接近人工参考。我们进一步表明,在 Conceptual Captions 数据集上,对于承担图像判别任务的人工标注者而言,判别性微调描述比原始 ClipCap 描述或真实描述更有帮助。

关键词

引用

@article{arxiv.2304.01662,
  title  = {Cross-Domain Image Captioning with Discriminative Finetuning},
  author = {Roberto Dessì and Michele Bevilacqua and Eleonora Gualdoni and Nathanael Carraz Rakotonirina and Francesca Franzon and Marco Baroni},
  journal= {arXiv preprint arXiv:2304.01662},
  year   = {2023}
}

备注

CVPR 2023