聚类诱导的生成式不完整图像-文本聚类(CIGIT-C)
人工智能
2022-12-01 v2
摘要
图像-文本聚类(ITC)的目标是通过整合这些异构样本的多模态互补与一致信息来发现正确簇。然而,当前多数研究在理想前提下分析 ITC,即每个模态中的样本都是完整的。但该假设在真实场景中并非总成立。缺失数据问题会退化图像-文本特征学习性能,并最终影响 ITC 任务的泛化能力。尽管已提出一系列方法解决此不完整图像-文本聚类问题(IITC),仍存在以下不足:1) 现有方法大多未考虑异构特征域间的显著鸿沟。2) 对于缺失数据,现有方法生成的表示很少能保证适合聚类任务。3) 现有方法未挖掘模态间与模态内的潜在联系。本文提出一种聚类诱导的生成式不完整图像-文本聚类(CIGIT-C)网络以应对上述挑战。具体而言,我们首先使用模态特定编码器将原始特征映射到更具区分性的子空间。通过使用对抗生成网络以一模态为条件生成另一模态,深入探索模态内与模态间的潜在联系。最后,我们利用两个 KL 散度损失更新相应的模态特定编码器。在公开图像-文本数据集上的实验结果表明,所提方法在 IITC 任务中表现更优且更有效。
引用
@article{arxiv.2209.13763,
title = {Clustering-Induced Generative Incomplete Image-Text Clustering (CIGIT-C)},
author = {Dongjin Guo and Xiaoming Su and Jiatai Wang and Limin Liu and Zhiyong Pei and Zhiwei Xu},
journal= {arXiv preprint arXiv:2209.13763},
year = {2022}
}
备注
13 pages,12 figures