中文

LM4LV:用于低级视觉任务的冻结大型语言模型

计算机视觉与模式识别 2024-06-12 v2

摘要

大型语言模型(LLM)的成功催生了多模态大型语言模型(MLLM)的新研究趋势,改变了计算机视觉各领域的范式。尽管MLLM在众多高级视觉和视觉-语言任务(如VQA和文本到图像)中展现出令人鼓舞的结果,但尚无工作展示低级视觉任务如何从MLLM中受益。我们发现,由于视觉模块的设计,当前大多数MLLM对低级特征不敏感,因此本质上无法解决低级视觉任务。在这项工作中,我们提出了LM4LV,一个使冻结的LLM能够解决一系列低级视觉任务的框架,无需任何多模态数据或先验知识。这展示了LLM在低级视觉方面的强大潜力,并弥合了MLLM与低级视觉任务之间的差距。我们希望这项工作能激发对LLM的新视角及其机制的更深入理解。代码可在https://github.com/bytetriper/LM4LV获取。

关键词

引用

@article{arxiv.2405.15734,
  title  = {LM4LV: A Frozen Large Language Model for Low-level Vision Tasks},
  author = {Boyang Zheng and Jinjin Gu and Shijun Li and Chao Dong},
  journal= {arXiv preprint arXiv:2405.15734},
  year   = {2024}
}