中文

用于图像聚类的多级跨模态对齐

计算机视觉与模式识别 2024-01-23 v1 机器学习

摘要

最近,跨模态预训练模型被用于生成有意义的伪标签来监督图像聚类模型的训练。然而,跨模态预训练模型中的大量错误对齐可能会产生低质量的伪标签并降低聚类性能。为了解决上述问题,我们提出了一种新颖的多级跨模态对齐方法,通过构建一个更小但更好的语义空间,并在三个级别(即实例级、原型级和语义级)上对齐图像和文本,来改善跨模态预训练模型在下游任务中的对齐。理论结果表明,我们提出的方法收敛,并提出了减少我们方法预期聚类风险的有效手段。在五个基准数据集上的实验结果清楚地显示了新方法的优越性。

关键词

引用

@article{arxiv.2401.11740,
  title  = {Multi-level Cross-modal Alignment for Image Clustering},
  author = {Liping Qiu and Qin Zhang and Xiaojun Chen and Shaotian Cai},
  journal= {arXiv preprint arXiv:2401.11740},
  year   = {2024}
}