中文

CLEAR:解锁退化图像理解在统一多模态模型中的生成潜力

计算机视觉与模式识别 2026-04-07 v1

摘要

图像因模糊、噪声、压缩和恶劣照明而产生的退化,严重削弱了现实场景中的多模态理解能力。能够将理解与生成集成于单一架构中的统一多模态模型,因其生成路径能够建模退化所破坏的细粒度视觉结构而是自然的解决方案。然而,这些模型未能充分利用自身的生成能力处理退化输入。我们追溯到两个相互叠加的因素:现有训练方案从未要求模型在推理过程中调用生成,标准的解码-重编码路径也不支持有效的联合优化。我们提出了 CLEAR 框架,通过三个渐进步骤将两种能力连接起来:(1)在针对退化的数据集上进行监督式精调,以建立生成-解答推理模式;(2)引入潜在表示桥接,取代解码-重编码的绕行路径,实现生成与推理之间的直接且可优化的连接;(3)引入交错式 GRPO,采用答案正确性奖励对文本推理与视觉生成进行联合优化。我们构建了 MMD-Bench,覆盖六个标准多模态基准测试中的三个退化严重程度等级。实验表明,CLEAR 在退化输入上显著提升了鲁棒性,同时保持了干净图像的性能。我们的分析进一步表明,移除像素级重建监督后,中间视觉状态的感知质量更高,表明任务导向的优化与视觉质量本质上是自然一致的。

关键词

引用

@article{arxiv.2604.04780,
  title  = {CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models},
  author = {Xiangzhao Hao and Zefeng Zhang and Zhenyu Zhang and Linhao Yu and Yao Chen and Yiqian Zhang and Haiyun Guo and Shuohuan Wang and Yu Sun},
  journal= {arXiv preprint arXiv:2604.04780},
  year   = {2026}
}