JECL:图像-文本对的联合嵌入与聚类学习
机器学习
2020-10-20 v3 机器学习
摘要
我们提出 JECL,一种通过以正则化聚类和对齐目标训练并行编码器来聚类图像-描述文本对的方法,同时学习表示与聚类分配。这类图像-描述文本对常出现在高价值应用中,其中结构化训练数据生成成本高昂,但自由文本描述十分常见。JECL 通过最小化图像与文本分布到联合目标分布之间的 Kullback-Leibler 散度,并优化图像与文本的软聚类分配之间的 Jensen-Shannon 散度来进行训练。还对 JECL 施加正则化以防止平凡解。实验表明,JECL 在大型基准图像-描述文本数据集上优于单视图与多视图方法,并且对缺失描述和不同数据规模具有显著鲁棒性。
引用
@article{arxiv.1901.01860,
title = {JECL: Joint Embedding and Cluster Learning for Image-Text Pairs},
author = {Sean T. Yang and Kuan-Hao Huang and Bill Howe},
journal= {arXiv preprint arXiv:1901.01860},
year = {2020}
}
备注
ICPR2020