BeautyGRPO:基于动态路径引导和细粒度偏好建模的面脸美化对齐
计算机视觉与模式识别
2026-03-03 v1
摘要
面脸美化需要在移除细微瑕疵的同时保留独特面部特征,以提升整体审美效果。然而,现有方法存在根本性的权衡。基于标记数据的监督学习受限于像素级标签模仿,无法捕捉复杂主观人类审美偏好。相反,尽管在线强化学习(RL)在偏好对齐方面表现出色,但其随机探索范式与面脸美化的高保真需求相冲突,常因累积的随机漂移引入明显的噪声伪影。为此,我们提出了 BeautyGRPO,一个与人类审美偏好对齐的强化学习框架。我们构建了 FRPref-10K 数据集,覆盖面脸美化的五个关键维度,并训练专门的奖励模型,以评估细微的感知差异。为解决探索与保真之间的矛盾,我们引入动态路径引导(DPG)。DPG 通过动态计算基于锚点的 ODE 路径,并在每个抽样时间步重新规划引导轨迹,从而纠正随机漂移,同时保持受控的探索。广泛的实验表明,BeautyGRPO 在专门的面脸美化方法和通用图像编辑模型中均表现出色,实现了卓越的纹理质量、更精准的瑕疵去除,以及更符合人类审美偏好的整体效果。
关键词
引用
@article{arxiv.2603.01163,
title = {BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling},
author = {Jiachen Yang and Xianhui Lin and Yi Dong and Zebiao Zheng and Xing Liu and Hong Gu and Yanmei Fang},
journal= {arXiv preprint arXiv:2603.01163},
year = {2026}
}
备注
Accepted by CVPR 2026