关于梯度在语言辅助图像聚类中的重要性:可证明的分析
计算机视觉与模式识别
2026-05-25 v4
摘要
本文探讨了最近出现的语言辅助图像聚类 (Language-assisted Image Clustering, LaIC) 问题,即利用文本语义来提高视觉表征的判别性,以促进图像聚类。由于缺乏真实类别名称,LaIC 的核心挑战之一在于如何从无标签的野生语料数据中筛选出正面名词,即与感兴趣图像最接近的名词。现有筛选策略主要基于 CLIP 学习到的特征空间,但尽管直观,这些策略缺乏严格的理论基础。为填补这一空白,我们提出了一种新型梯度基方法,称为 GradNorm,该方法在理论上得到保证且在实验中表现出色。具体而言,我们根据从交叉熵到 softmax 输出之间预测目标分布的梯度大小来衡量每个名词的正面程度。理论上,我们提供了严格的误差界来量化 GradNorm 如何区分正面名词,并证明 GradNorm 本质上包含了现有筛选策略作为其极端特殊情况。实验方面,广泛的实验表明 GradNorm 在各种基准数据集上实现了图像聚类的最新性能。代码已公开于 \href{https://github.com/60pen9/On-the-Provable-Importance-of-Gradients-for-Language-Assisted-Image-Clustering}{here}。
引用
@article{arxiv.2510.16335,
title = {On the Provable Importance of Gradients for Language-Assisted Image Clustering},
author = {Bo Peng and Jie Lu and Guangquan Zhang and Zhen Fang},
journal= {arXiv preprint arXiv:2510.16335},
year = {2026}
}
备注
revised and extended version of ICCV2025