中文

UniSER:统一软性效果去除的基础模型

计算机视觉与模式识别 2026-04-29 v3

摘要

数字图像常因镜头光晕、雾霾、阴影和反射等柔软效果受损,这些效果虽不完全遮蔽像素,却显著降低审美。现有工作针对性地分别处理这些退化,发展高度专业化的专家模型,缺乏可扩展性且未能利用这些恢复问题的共同本质。与此同时,尽管近期大型通用模型(如 GPT-4o、Flux Kontext、Nano Banana)提供强大的文本驱动编辑能力,但依赖详细提示,往往难以在保持场景身份的同时实现对此类细粒度任务的稳健去除。基于柔软效果的共同本质,即半透明遮挡,本文引入基础通用模型 UniSER,能够在单一框架内解决由柔软效果引起的多样化退化。其方法核心在于构建大型 380 万对数据集,确保鲁棒性和泛化性,其中包括新颖且物理上合理的数据,以填补公共基准数据集中的关键空白,并设计专门的训练管道,对 Diffusion Transformer 进行微调,从这些多样化数据中学习稳健的恢复先验,集成细粒度掩码和强度控制。这种协同方法使 UniSER 在专业和通用模型之间实现显著超越,实现野外环境下的稳健、高保真恢复。

关键词

引用

@article{arxiv.2511.14183,
  title  = {UniSER: A Foundation Model for Unified Soft Effects Removal},
  author = {Jingdong Zhang and Lingzhi Zhang and Qing Liu and Mang Tik Chiu and Connelly Barnes and Yizhou Wang and Haoran You and Xiaoyang Liu and Yuqian Zhou and Zhe Lin and Eli Shechtman and Sohrab Amirghodsi and Xin Li and Wenping Wang and Xiaohang Zhan},
  journal= {arXiv preprint arXiv:2511.14183},
  year   = {2026}
}