中文

利用视觉语言模型理解图像退化

计算机视觉与模式识别 2026-02-05 v1

摘要

理解视觉退化是计算机视觉中一个关键但具有挑战性的问题。虽然最近的视觉语言模型在定性描述方面表现出色,但它们通常难以理解图像退化背后的参数化物理过程。在这项工作中,我们将退化理解重新定义为一个层次化的结构化预测任务,需要同时估计退化类型、参数键及其连续的物理值。尽管这些子任务在不同的空间中运行,但我们证明它们可以统一在一个自回归的下一个词元预测范式下,其误差受限于值空间量化网格。基于这一见解,我们引入了DU-VLM,一个多模态思维链模型,通过监督微调和基于结构化奖励的强化学习进行训练。此外,我们展示了DU-VLM可以作为预训练扩散模型的零样本控制器,无需微调生成骨干网络即可实现高保真图像恢复。我们还引入了DU-110k,一个包含110,000个带有物理标注的干净-退化图像对的大规模数据集。大量实验表明,我们的方法在准确性和鲁棒性方面显著优于通用基线,并展现出对未见分布的泛化能力。

关键词

引用

@article{arxiv.2602.04565,
  title  = {Understanding Degradation with Vision Language Model},
  author = {Guanzhou Lan and Chenyi Liao and Yuqi Yang and Qianli Ma and Zhigang Wang and Dong Wang and Bin Zhao and Xuelong Li},
  journal= {arXiv preprint arXiv:2602.04565},
  year   = {2026}
}

备注

17 pages