中文

SmartPhotoCrafter:面向自动摄影图像编辑的统一推理、生成与优化

计算机视觉与模式识别 2026-04-22 v1

摘要

传统的摄影图像编辑通常要求用户具备足够的美学理解能力,以便为调整图像质量和相机参数提供适当的指令。然而,这种范式依赖于对美学意图的显式人工指令,这对于非专业用户来说通常是模糊的、不完整的或难以实现的。在这项工作中,我们提出了 SmartPhotoCrafter,一种自动摄影图像编辑方法,该方法将图像编辑表述为一个紧密耦合的推理到生成过程。所提出的模型首先执行图像质量理解,并通过 Image Critic 模块识别缺陷,然后 Photographic Artist 模块实现针对性编辑以增强图像吸引力,从而无需显式的人工指令。我们采用了多阶段训练流程: 基础预训练,以建立基本的美学理解和编辑能力; 基于推理引导的多编辑监督的适应,以融入丰富的语义指导; 协调的推理到生成强化学习,以联合优化推理和生成。在训练期间,SmartPhotoCrafter 强调照片级真实感图像生成,同时支持图像修复和润饰任务,并始终遵守与色彩和色调相关的语义。我们还构建了一个特定阶段的数据集,逐步构建推理和可控生成、有效的跨模块协作,以及最终的高质量摄影增强。实验表明,SmartPhotoCrafter 在自动摄影增强任务上优于现有的生成模型,在实现照片级真实感结果的同时,对润饰指令表现出更高的色调敏感性。项目页面:https://github.com/vivoCameraResearch/SmartPhotoCrafter。

关键词

引用

@article{arxiv.2604.19587,
  title  = {SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing},
  author = {Ying Zeng and Miaosen Luo and Guangyuan Li and Yang Yang and Ruiyang Fan and Linxiao Shi and Qirui Yang and Jian Zhang and Chengcheng Liu and Siming Zheng and Jinwei Chen and Bo Li and Peng-Tao Jiang},
  journal= {arXiv preprint arXiv:2604.19587},
  year   = {2026}
}

备注

tech report