AesFormer:将日常照片转化为美丽回忆
计算机视觉与模式识别
2026-05-22 v1
摘要
在日常摄影中,常常以结构性缺陷(如构图、摄像机视角或姿势)捕获令人惊艳的瞬间,这些缺陷已无法被现有的美化和肖像增强方法修复。我们将美学照片重建 (APR) 定义为通过结构重建提高照片美学质量,同时保留主体身份和场景语义。尽管最近的图像编辑模型使得 APR 可行,但它们往往缺乏美学理解,导致编辑在语义上合理但美学上有限。为此,我们提出 AesFormer,一个双阶段框架,将美学规划与图像编辑解耦。在阶段 1 中,美学动作模型 (AesThinker) 对输入进行分析,沿七个递进的摄影维度输出可执行的编辑动作,并进一步应用 GRPO-A 以鼓励对多样化动作计划的广泛探索,超越 SFT。在阶段 2 中,动作条件编辑器 (AesEditor) 根据这些动作执行结构化编辑。为支持 APR,我们构建了一个基于视频的语料库挖掘管道 (VCMP),并构建 AesRecon,一个包含 9,071 对严格对齐(差,好)图像对的基准。实验表明,AesFormer 在 APR 性能上显著提升,且与 Nano Banana Pro 相当。代码已公开 https://github.com/PKU-ICST-MIPL/AesFormer_ICML2026。
关键词
引用
@article{arxiv.2605.22126,
title = {AesFormer: Transform Everyday Photos into Beautiful Memories},
author = {Tianxiang Du and Hulingxiao He and Yuxin Peng},
journal= {arXiv preprint arXiv:2605.22126},
year = {2026}
}
备注
Accepted by ICML 2026