LM4LV:用于低级视觉任务的冻结大型语言模型
计算机视觉与模式识别
2024-06-12 v2
摘要
大型语言模型(LLM)的成功催生了多模态大型语言模型(MLLM)的新研究趋势,改变了计算机视觉各领域的范式。尽管MLLM在众多高级视觉和视觉-语言任务(如VQA和文本到图像)中展现出令人鼓舞的结果,但尚无工作展示低级视觉任务如何从MLLM中受益。我们发现,由于视觉模块的设计,当前大多数MLLM对低级特征不敏感,因此本质上无法解决低级视觉任务。在这项工作中,我们提出了LM4LV,一个使冻结的LLM能够解决一系列低级视觉任务的框架,无需任何多模态数据或先验知识。这展示了LLM在低级视觉方面的强大潜力,并弥合了MLLM与低级视觉任务之间的差距。我们希望这项工作能激发对LLM的新视角及其机制的更深入理解。代码可在https://github.com/bytetriper/LM4LV获取。
引用
@article{arxiv.2405.15734,
title = {LM4LV: A Frozen Large Language Model for Low-level Vision Tasks},
author = {Boyang Zheng and Jinjin Gu and Shijun Li and Chao Dong},
journal= {arXiv preprint arXiv:2405.15734},
year = {2024}
}