中文

解锁美的本质:基于相对-绝对策略优化的高级美学推理

计算机视觉与模式识别 2025-09-29 v1 人工智能

摘要

多模态大语言模型非常适合图像美学评估,因为它们能够利用跨模态理解能力捕捉高层美学特征。然而,多模态美学推理数据的稀缺性以及美学判断固有的主观性,使得 MLLM 难以生成带有可解释依据的准确美学判断。为此,我们提出了 Aes-R1,一个结合强化学习(RL)的综合美学推理框架。具体而言,Aes-R1 集成了一个名为 AesCoT 的流程,用于构建和筛选用于冷启动的高质量思维链美学推理数据。在教会模型在打分之前生成结构化解释之后,我们采用相对-绝对策略优化(RAPO),这是一种联合优化绝对分数回归与相对排序的全新 RL 算法,可同时提升单图准确率和跨图偏好判断能力。Aes-R1 使 MLLM 能够生成有依据的解释以及忠实的分数,从而在一个统一框架中增强美学打分与推理。大量实验表明,Aes-R1 将骨干模型的平均 PLCC/SRCC 提升了 47.9%/34.8%,超越了同等规模的 SOTA 基线。更多消融研究验证了 Aes-R1 在有限监督和分布外场景下的稳健泛化能力。

关键词

引用

@article{arxiv.2509.21871,
  title  = {Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization},
  author = {Boyang Liu and Yifan Hu and Senjie Jin and Shihan Dou and Gonglei Shi and Jie Shao and Tao Gui and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2509.21871},
  year   = {2025}
}