AesRM:利用专家级反馈提升视频美学
计算机视觉与模式识别
2026-05-01 v1
摘要
尽管照片级真实感视频生成技术发展迅速,但电影制作等现实应用要求视频美学(例如和谐的色彩和电影级布光)超越视觉保真度。先前关于视觉美学的工作主要集中在图像上,常常将美学简化为粗略的定义,如视觉愉悦感,缺乏严谨和系统的评估。为了提升视频美学,我们提出了一种分层评分标准,将视频美学分解为三个核心维度:视觉美学(VA)、视觉保真度(VF)和视觉合理性(VP),并包含 15 个细粒度标准,如镜头构图。该框架促成了一个大规模专家标注的偏好数据集和一个评估基准 AesVideo-Bench,包含约 2500 个带有 VA、VF 和 VP 专家标注的视频对。然后,我们构建了一系列视频美学奖励模型(AesRM):AesRM-Base,直接预测这些维度上的成对偏好,以提供高效的训练后奖励;以及 AesRM-CoT,额外生成与所有 15 个标准对齐的思维链(CoT),以提高评估的可解释性。具体来说,我们采用三阶段渐进式方案训练 AesRM:(1)原子美学能力学习,增强 AesRM 对基本美学概念的识别,例如准确识别居中构图;(2)冷启动,使模型与结构化推理协议对齐;(3)GRPO,进一步提高评估准确性。为了增强 AesRM-CoT,我们还提出了基于自一致性的 CoT 合成,以提高 CoT 质量,并在 GRPO 期间设计了基于 CoT 的过程奖励。大量实验表明,AesRM 在多个美学基准上优于基线模型,并且更鲁棒,位置偏差更低。最后,我们使用 AesRM 对齐 Wan2.2,并观察到相较于现有美学奖励模型,获得了明显的美学增益。
引用
@article{arxiv.2604.28078,
title = {AesRM: Improving Video Aesthetics with Expert-Level Feedback},
author = {Yujin Han and Yujie Wei and Yefei He and Xinyu Liu and Tianle Li and Zichao Yu and Andi Han and Shiwei Zhang and Tingyu Weng and Difan Zou},
journal= {arXiv preprint arXiv:2604.28078},
year = {2026}
}
备注
37 pages, 14 figures, 12 tables