中文

面向生成式低光图像增强的大型视觉语言模型迭代与手动指令适配

计算机视觉与模式识别 2026-05-04 v2

摘要

大多数现有低光图像增强(LLIE)方法依赖预训练模型先验、低光输入或两者,忽视了来自正常光照图像的语义指导,限制了其在复杂光照条件下的效果。本文提出 VLM-IMI,一个通过迭代与手动指令适配大型视觉语言模型实现生成式 LLIE 的框架。VLM-IMI 包含两个主要分支:正常光照指令先验生成(NL-IPG)和指令感知光照增强扩散(IA-LED)。NL-IPG 将所需正常光照内容的文本描述作为增强线索,实现语义导向的恢复。IA-LED 将 NL-IPG 的指令先验融入扩散过程,实现精准的光照增强。为有效集成跨模态先验,我们引入可学习的指令先验融合模块,动态对齐并融合图像与文本特征,促进生成详细且语义连贯的输出。在推理阶段,由于正常光照图像不可得,我们提出迭代指令策略,以不断细化文本指令,逐步提升视觉质量。VLM-IMI 还原生支持手动指令控制,允许用户直接输入自定义指令由 LLM 生成预期输出。跨多场景实验表明,VLM-IMI 在感知和真实性方面均优于 SOTA 方法。源码已公开:https://github.com/sunxiaoran01/VLM-IMI。

关键词

引用

@article{arxiv.2507.18064,
  title  = {Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement},
  author = {Xiaoran Sun and Liyan Wang and Yeying Jin and Kin-man Lam and Zhixun Su and Yang Yang and Jinshan Pan and Cong Wang},
  journal= {arXiv preprint arXiv:2507.18064},
  year   = {2026}
}

备注

11 papers,8 figures, CVPR2026 Findings