考虑 Wasserstein 图匹配的半监督图像描述
计算机视觉与模式识别
2024-03-28 v1 人工智能
机器学习
摘要
图像描述可以为给定图像自动生成描述文本,关键挑战在于学习从视觉特征到自然语言特征之间的映射函数。现有方法大多为监督式,即每张图像在训练集中都有一个对应的句子。然而,考虑到描述图像始终需要大量人力,在实际应用中我们通常只有大量未描述的图像和有限数量的已描述图像(即图像-文本对)。于是出现了一个困境,即“半监督图像描述”。为解决此问题,我们提出一种新型半监督图像描述方法,考虑 Wasserstein 图匹配(SSIC-WGM),其尝试以原始图像输入来监督生成的句子。与传统单模态半监督方法不同,半监督跨模态学习的难点在于构建异构模态之间可比较的中间信息。本文中,SSIC-WGM采用成功的场景图作为中间信息,并从两个方面约束生成的句子:1)跨模态一致性。SSIC-WGM分别构建原始图像和生成句子的场景图,然后采用 Wasserstein 距离更准确地衡量不同图中区域嵌入的相似度。2)单模态一致性。SSIC-WGM对原始图像采用数据增强技术,然后约束增强图像与生成句子之间的一致性。因此,SSIC-WGM将跨模态伪监督和结构不变性度量相结合,高效地利用未描述的图像,并学习更合理的映射函数。
关键词
引用
@article{arxiv.2403.17995,
title = {Semi-Supervised Image Captioning Considering Wasserstein Graph Matching},
author = {Yang Yang},
journal= {arXiv preprint arXiv:2403.17995},
year = {2024}
}