中文

LucidNFT:基于 LR 锚定的多奖励偏好优化用于流动式现实世界超分辨率

计算机视觉与模式识别 2026-05-13 v3

摘要

生成式现实世界图像超分辨率 (Real-ISR) 能够从严重降解的低分辨率 (LR) 输入合成视觉上令人信服的细节,但其随机抽样会导致一个关键失败模式:输出可能看起来清晰,却不忠实于 LR 证据,表现出语义或结构幻觉。基于偏好强化学习 (RL) 是一种自然的选择,因为每个 LR 输入会产生一组候选恢复方案。然而,在 Real-ISR 中实现有效对齐面临三个相互关联的挑战:(i)缺乏对 LR 的参考忠诚信号,这种信号对降解鲁棒但对局部幻觉敏感;(ii)滚动组优化瓶颈,在归一化前对异构奖励进行标量化会压缩目标间对比度,削弱了基于 DiffusionNFT 的奖励加权更新;(iii)现实降解的覆盖范围有限,这限制了滚动多样性和偏好信号质量。我们提出了 LucidNFT,一个用于流匹配 Real-ISR 的多奖励 RL 框架。LucidNFT 引入了 LucidConsistency,即一种基于内容一致降解池和原图硬负样本训练的、降解不变且对幻觉敏感的 LR 参考评估器;一种解耦的奖励归一化策略,在每个 LR 条件下的滚动组内保留目标间对比度后再融合;以及 LucidLR,一个大规模的现实世界降解图像集合,用于稳健的 RL 微调。大量实验表明,LucidNFT 在强大的基于流的 Real-ISR 基线上提高了感知质量,同时在 diverse 的现实场景中保持了 LR 参考一致性。

关键词

引用

@article{arxiv.2603.05947,
  title  = {LucidNFT: LR-Anchored Multi-Reward Preference Optimization for Flow-Based Real-World Super-Resolution},
  author = {Song Fei and Tian Ye and Sixiang Chen and Zhaohu Xing and Jianyu Lai and Lei Zhu},
  journal= {arXiv preprint arXiv:2603.05947},
  year   = {2026}
}