通过在多源数据集上利用语义和风格生成更贴切的图像描述
计算机视觉与模式识别
2023-12-01 v3 人工智能
计算与语言
多媒体
摘要
本文致力于解决通过训练非均匀组合的数据源(包含人工标注和网络收集的描述)来生成流畅描述的任务。大规模且带有噪声的图像-文本对数据集,由于其低质量的描述风格,确实提供了一个次优的监督来源,而人工标注的数据集虽然更干净,但规模较小。为了兼取两者之长,我们提出通过引入风格标记和通过检索组件提取的关键词来利用并分离语义和描述风格。所提出的模型避免了使用目标检测器的需要,仅通过一个提示语言建模目标进行训练,并且能够在具有不同输入风格的数据源上训练时,复制人工收集的描述风格。实验表明,该模型在识别现实世界概念和生成高质量描述方面表现出强大的能力。我们在不同的图像描述数据集上进行了广泛的实验,包括 CC3M、nocaps 和具有竞争力的 COCO 数据集,我们的模型在这些数据集上始终优于基线方法和最先进的方法。
引用
@article{arxiv.2111.12727,
title = {Generating More Pertinent Captions by Leveraging Semantics and Style on Multi-Source Datasets},
author = {Marcella Cornia and Lorenzo Baraldi and Giuseppe Fiameni and Rita Cucchiara},
journal= {arXiv preprint arXiv:2111.12727},
year = {2023}
}
备注
Accepted to IJCV