中文

基于测试时偏好优化的图像修复

计算机视觉与模式识别 2025-11-25 v1

摘要

图像修复(IR)模型通常使用 L1 或 LPIPS 损失来恢复高质量图像。为处理多样化的未知退化,零样本 IR 方法也被引入。然而,现有的预训练和零样本 IR 方法往往无法与人类偏好保持一致,导致恢复后的图像可能并不受人类青睐。这凸显了有必要在不要求模型重新训练的情况下(理想情况下无需人工密集型偏好数据收集)提升修复质量并灵活适应各种图像修复任务或主干网络的关键需求。本文提出了首个用于图像修复的测试时偏好优化(Test-Time Preference Optimization, TTPO)范式,该范式增强感知质量,动态生成偏好数据,且与任何 IR 模型主干兼容。具体而言,我们设计了一个无训练的三阶段管线:(i)基于初始恢复图像的扩散反向变换和去噪,在线生成候选偏好图像;(ii)使用自动偏好对齐指标或人类反馈选择偏好图像和不偏好图像;(iii)将选定的偏好图像作为奖励信号,用于引导扩散去噪过程,优化恢复图像以更好地与人类偏好保持一致。跨各种图像修复任务和模型的大量实验表明,所提管线的有效性和灵活性。

关键词

引用

@article{arxiv.2511.19169,
  title  = {Test-Time Preference Optimization for Image Restoration},
  author = {Bingchen Li and Xin Li and Jiaqi Xu and Jiaming Guo and Wenbo Li and Renjing Pei and Zhibo Chen},
  journal= {arXiv preprint arXiv:2511.19169},
  year   = {2025}
}

备注

Accepted by AAAI26