中文

基于通用熵优化的现实无监督 CLIP 微调

计算机视觉与模式识别 2024-07-19 v2 机器学习

摘要

视觉-语言模型(如 CLIP)的出现,激发了大量将其应用于下游监督学习任务的研究。尽管已有一些研究探索了 CLIP 的无监督微调,但它们通常依赖于与真实标签相关联的类名形式的先验知识。本文探讨了一种现实的无监督微调场景,考虑到无标签数据中存在来自未知类的分布外样本。具体而言,我们致力于同时提升分布外检测与已知类实例的识别能力。为解决该问题,我们提出了一种简单、高效且有效的方法,称为通用熵优化(Universal Entropy Optimization, UEO)。UEO 利用样本级置信度来近似最小化高置信度实例的条件熵,并最大化低置信度实例的边缘熵。除优化文本提示外,UEO 还融入了对 CLIP 视觉分支中通道级仿射变换的优化。在 15 个领域和 4 种不同类型先验知识上的大量实验验证了 UEO 相较基线方法的有效性。代码已公开于 \url{https://github.com/tim-learn/UEO}。

关键词

引用

@article{arxiv.2308.12919,
  title  = {Realistic Unsupervised CLIP Fine-tuning with Universal Entropy Optimization},
  author = {Jian Liang and Lijun Sheng and Zhengbo Wang and Ran He and Tieniu Tan},
  journal= {arXiv preprint arXiv:2308.12919},
  year   = {2024}
}

备注

ICML 2024 Highlight