中文

将图像处理统一为视觉提示问答

计算机视觉与模式识别 2024-02-22 v2 图像与视频处理

摘要

图像处理是计算机视觉中的基础任务,旨在提升图像质量并提取关键特征以用于后续视觉应用。传统上,针对个别任务开发特定任务模型,且此类模型设计需要不同专业知识。基于大语言模型(LLMs)在自然语言处理(NLP)中的成功,计算机视觉领域出现类似趋势,聚焦于通过预训练与上下文学习开发大规模模型。这种范式转变降低了对特定任务模型的依赖,催生出应对各类任务的强大统一模型。然而,这些进展主要集中于高层视觉任务,对低层视觉任务关注较少。为解决这个问题,我们提出一个涵盖图像复原、图像增强、图像特征提取等任务的通用图像处理模型。我们提出的框架名为 PromptGIP,将这些多样图像处理任务统一于一个通用框架内。受 NLP 问答(QA)技术启发,我们采用视觉提示问答范式。具体而言,我们将输入输出图像对视为结构化问答句,从而将图像处理任务重编程为提示 QA 问题。PromptGIP 可利用所给视觉提示执行多样跨域任务,无需特定任务微调。我们的方法为通用图像处理提供了通用且自适应的方案。尽管 PromptGIP 已展现出一定程度的域外任务泛化能力,仍期待进一步研究以充分发掘其更强大的涌现泛化能力。

关键词

引用

@article{arxiv.2310.10513,
  title  = {Unifying Image Processing as Visual Prompting Question Answering},
  author = {Yihao Liu and Xiangyu Chen and Xianzheng Ma and Xintao Wang and Jiantao Zhou and Yu Qiao and Chao Dong},
  journal= {arXiv preprint arXiv:2310.10513},
  year   = {2024}
}

备注

16 pages, 12 figures