基于文本条件视频生成的渐进图像修复
计算机视觉与模式识别
2025-12-03 v1 人工智能
摘要
近期的文本到视频模型在时序生成能力方面表现突出,但其在图像修复中的潜力尚未得到充分探索。本文通过微调 CogVideo 以生成修复轨迹而非自然视频运动,来重新定位其用于渐进式视觉修复任务。具体而言,我们为超分辨率、去模糊和低光增强构建合成数据集,其中每个样本 depict 从退化帧到干净帧的渐进过渡。比较了两种提示策略:一种是所有样本共享的统一文本提示,另一种是通过 LLaVA 多模态 LLM 生成的场景特定提示方案。我们的微调模型学习将时间进度与修复质量关联,生成的序列在帧之间提高诸如 PSNR、SSIM 和 LPIPS 等感知指标。大量实验表明,CogVideo 有效地在保持时序一致性的同时恢复空间细节和照明一致性。此外,该模型在无需额外训练的情况下对 ReLoBlur 数据集中的真实场景具有强大的零样本鲁棒性和通过时序修复的可解释性。
引用
@article{arxiv.2512.02273,
title = {Progressive Image Restoration via Text-Conditioned Video Generation},
author = {Peng Kang and Xijun Wang and Yu Yuan},
journal= {arXiv preprint arXiv:2512.02273},
year = {2025}
}
备注
First two authors contributed equally to this work. IEEE ICNC Accepted