中文

LLaFS:当大语言模型遇见少样本分割

计算机视觉与模式识别 2024-04-04 v5

摘要

本文提出 LLaFS,首次尝试在少样本分割中利用大语言模型(LLMs)。与仅依赖带标注支持图像中有限且有偏信息的传统少样本分割方法不同,LLaFS 将 LLM 获得的大量先验知识作为有效补充,并直接以少样本方式使用 LLM 分割图像。为使基于文本的 LLM 能处理图像相关任务,我们精心设计了输入指令使 LLM 能输出以多边形表示的分割结果,并提出区域属性表以模拟人类视觉机制并提供多模态引导。我们还合成伪样本并使用课程学习进行预训练,以扩充数据并实现更好的优化。LLaFS 在多个数据集上取得了最先进(SOTA)结果,展示了使用 LLM 进行少样本计算机视觉任务的潜力。

关键词

引用

@article{arxiv.2311.16926,
  title  = {LLaFS: When Large Language Models Meet Few-Shot Segmentation},
  author = {Lanyun Zhu and Tianrun Chen and Deyi Ji and Jieping Ye and Jun Liu},
  journal= {arXiv preprint arXiv:2311.16926},
  year   = {2024}
}

备注

Accepted to CVPR2024