基于视觉-语言评论家的自演化视觉概念库
计算机视觉与模式识别
2025-04-02 v1 机器学习
摘要
我们研究了构建用于视觉识别的视觉概念库的问题。构建有效的视觉概念库具有挑战性,因为手动定义工作量大,而仅依赖大语言模型(LLM)生成概念可能导致概念缺乏判别力,或未能考虑概念之间复杂的相互作用。我们的 метод ESCHER 从库学习角度出发,迭代发现并改进视觉概念。ESCHER 使用视觉-语言模型(VLM)作为评论家,迭代细化概念库,包括考虑概念之间的相互作用以及它们对下游分类器的影响。通过利用 LLM 的上下文学习能力以及 various concepts 的历史性能,ESCHER 能在 VLM 评论家反馈基础上动态改进其概念生成策略。最终,ESCHER 不需要任何人工标注,因此是一个自动化的即插即用框架。我们经验性地展示了 ESCHER 学习用于零样本、few-shot 和 fine-tuning 视觉分类任务的概念库的能力。这项工作在我们所知的第一项将概念库学习应用于真实世界视觉任务。
关键词
引用
@article{arxiv.2504.00185,
title = {Self-Evolving Visual Concept Library using Vision-Language Critics},
author = {Atharva Sehgal and Patrick Yuan and Ziniu Hu and Yisong Yue and Jennifer J. Sun and Swarat Chaudhuri},
journal= {arXiv preprint arXiv:2504.00185},
year = {2025}
}
备注
CVPR camera ready