Venus:面向审美引导与裁切的多模态大语言模型基准测试与赋能
计算机视觉与模式识别
2026-03-02 v1
摘要
智能手机的广泛使用使得摄影变得无处不在,但普通用户与专业摄影师之间仍存在明显差距,后者能够识别审美问题并在拍摄过程中提供可操作的拍摄建议。我们将这种能力定义为审美引导(AG),这是计算审美领域中一个重要但 largely 未被充分探索的领域。现有的多模态大语言模型(MLLM)主要提供过于积极的反馈,无法识别问题或提供可操作的建议。缺乏 AG 能力的模型无法有效识别分散注意力的区域或优化构图平衡,因而在审美裁切方面也难以胜任,该任务旨在通过重新构图在拍摄后细化照片构图。为此,我们引入 AesGuide,第一个大规模 AG 数据集和基准,包含 10,748 张照片,标注了审美得分、分析和指导。基于此,我们提出了 Venus 框架,该框架通过逐步递增的复杂审美问题来赋能 MLLM 具备 AG 能力,然后通过基于链条的理由激发其审美裁切能力。大量实验表明,Venus 在 AG 能力上显著提升,并在审美裁切方面实现最先进(SOTA)性能,使其在照片创建的两个阶段都能够实现可解释且可交互的审美细化。代码可在 https://github.com/PKU-ICST-MIPL/Venus_CVPR2026 获取。
引用
@article{arxiv.2602.23980,
title = {Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping},
author = {Tianxiang Du and Hulingxiao He and Yuxin Peng},
journal= {arXiv preprint arXiv:2602.23980},
year = {2026}
}
备注
Accepted by CVPR 2026