中文

基于大语言模型智能体的小样本图像分类与分割

计算机视觉与模式识别 2023-11-22 v1 人工智能

摘要

小样本图像分类与分割(FS-CS)任务要求在仅给定目标类别少量样本的情况下,对查询图像中的目标物体进行分类与分割。我们提出一种方法,利用大语言模型(LLM)作为智能体,以无需训练的方式解决 FS-CS 问题。通过让 LLM 充当任务规划器、现成视觉模型充当工具,所提方法仅使用图像级标签即可对目标物体进行分类与分割。具体而言,思维链提示与上下文学习引导 LLM 像人类一样观察支持图像;Segment Anything Model(SAM)与 GPT-4Vision 等视觉模型同时辅助 LLM 理解空间与语义信息。最终,LLM 利用其总结与推理能力对查询图像进行分类与分割。所提方法的模块化框架使其易于扩展。我们的方法在 Pascal-5i 数据集上取得了最先进的性能。

关键词

引用

@article{arxiv.2311.12065,
  title  = {Few-Shot Classification & Segmentation Using Large Language Models Agent},
  author = {Tian Meng and Yang Tao and Wuliang Yin},
  journal= {arXiv preprint arXiv:2311.12065},
  year   = {2023}
}