中文

MiniGPT-逆向设计:利用MiniGPT-4预测图像调整

计算机视觉与模式识别 2025-06-10 v2 人工智能

摘要

视觉语言模型(VLM)近期通过与大型语言模型(LLM)的集成取得了显著进展。同时处理图像和文本模态的VLM已展现出在多种多模态任务中学习和理解图像与文本之间交互的能力。逆向设计可被定义为一个复杂的视觉语言任务,旨在根据给定的源图像、编辑后的版本以及可选的高级文本编辑描述,预测编辑操作及其参数。该任务要求VLM同时理解源图像、编辑后版本以及可选的文本上下文之间的相互作用,超越了传统的视觉语言任务。在本文中,我们扩展并微调了MiniGPT-4以执行逆向设计任务。我们的实验证明了现成VLM(特别是MiniGPT-4)在诸如逆向设计等更复杂任务上的可扩展性。代码可在以下链接获取:https://github.com/VahidAz/MiniGPT-Reverse-Designing

关键词

引用

@article{arxiv.2406.00971,
  title  = {MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4},
  author = {Vahid Azizi and Fatemeh Koochaki},
  journal= {arXiv preprint arXiv:2406.00971},
  year   = {2025}
}

备注

8 pages, 7 figures