减少偏差与方差:基于生成语义指导和双层集成的图像聚类
计算机视觉与模式识别
2026-05-26 v2 机器学习
摘要
图像聚类旨在将无标签图像数据集划分为distinct的组。这一任务的核心方面在于构建和利用先验知识来指导聚类过程。最近的研究方法引入语义描述作为先验信息,通常依赖于基于匹配的技术和预定义的词汇表。然而,受限的匹配空间限制了其对下游聚类任务的适应性。此外,这些方法主要关注通过减少偏差来提高性能,经常忽视方差减小时的重要性。为此,我们提出了 GSEC(基于生成语义指导和双层集成的图像聚类),该框架旨在通过生成语义指导来减少偏差,并通过集成学习来缓解方差。我们的方法采用多模态大型语言模型生成语义描述,并通过加权平均法获取图像嵌入。此外,采用 BatchEnsemble 在内层集成跨模态信息,并在外层通过对齐机制对输出进行对齐。比较实验表明,GSEC 在六个基准数据集上超过 18 个最先进的方法,进一步分析确认了其在同时减少偏差和方差方面的有效性。代码可在 https://github.com/2017LI/GSEC.git 获取。
引用
@article{arxiv.2605.12961,
title = {Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering},
author = {Feijiang Li and Zhenxiong Li and Jieting Wang and Zizheng Jiu and Saixiong Liu and Liang Du},
journal= {arXiv preprint arXiv:2605.12961},
year = {2026}
}