自适应上下文关系:面向多模态超分辨率的可证明方法
计算机视觉与模式识别
2026-05-12 v1
摘要
超分辨率 (SR) 是一个严重难以准确解决的问题,因其内在歧义已被广泛认识于实证与理论研究之中。虽然最近的语义引导型和多模态 SR 方法利用大型模型或外部先验以增强语义对齐,但在实践和理论中的异构模态融合仍不充分。本文首次对多模态 SR 进行理论建模,揭示先前方法受限于次优模态利用。我们的分析表明,通过强化模态权重与其有效贡献之间的对齐,同时降低表示复杂度,可改善 generalization 风险上界。这一理论洞见启发我们提出一种新颖的多模态 Mixture-of-Experts 超分辨率框架 (MESR),其采用面向 generalization 的动态模态融合,以实现准确的风险控制和模态贡献优化。具体而言,我们提出一种新颖的空间动态模态加权模块和一种时序自适应模态温度调度机制,使我们能够灵活且自适应地进行空间-时序模态加权,以实现有效的风险控制。大量实验表明,我们的 MESR 在 generalization 和语义一致性性能方面显著提升,证明了其优越性。
引用
@article{arxiv.2605.10470,
title = {Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution},
author = {Jinyi Luo and Minghao Liu and Yifan Li and Zejia Fan and Jiaying Liu},
journal= {arXiv preprint arXiv:2605.10470},
year = {2026}
}