中文

建模协作者:通过LLM工具使用以最少人力实现主观视觉分类

计算机视觉与模式识别 2024-03-21 v2 机器学习

摘要

从内容审核到野生动物保护,需要模型识别细微或主观视觉概念的应用数量正在增长。传统上,为此类概念开发分类器需要大量手动工作,耗时数小时、数天甚至数月来识别和注释训练所需的数据。即使使用最近提出的敏捷建模技术,该技术能够快速引导图像分类器,用户仍然需要花费30分钟或更长时间进行单调重复的数据标注,仅为了训练一个分类器。借鉴Fiske的认知吝啬鬼理论,我们提出了一个新框架,通过用自然语言交互替代人工标注来减轻手动工作,将定义概念所需的总工作量减少一个数量级:从标注2000张图像减少到仅100张加上一些自然语言交互。我们的框架利用基础模型的最新进展,包括大语言模型和视觉-语言模型,通过对话和自动标注训练数据点来划分概念空间。最重要的是,我们的框架消除了对众包标注的需求。此外,我们的框架最终产生轻量级分类模型,可在成本敏感场景中部署。在15个主观概念和2个公共图像分类数据集上,我们训练的模型优于传统的敏捷建模以及最先进的零样本分类模型如ALIGN、CLIP、CuPL,以及大型视觉问答模型如PaLI-X。

关键词

引用

@article{arxiv.2403.02626,
  title  = {Modeling Collaborator: Enabling Subjective Vision Classification With Minimal Human Effort via LLM Tool-Use},
  author = {Imad Eddine Toubal and Aditya Avinash and Neil Gordon Alldrin and Jan Dlabal and Wenlei Zhou and Enming Luo and Otilia Stretcu and Hao Xiong and Chun-Ta Lu and Howard Zhou and Ranjay Krishna and Ariel Fuxman and Tom Duerig},
  journal= {arXiv preprint arXiv:2403.02626},
  year   = {2024}
}