中文

AesTest:从感知到生产衡量审美智能的基准

计算机视觉与模式识别 2025-11-11 v1

摘要

感知与产生审美判断是多模态大语言模型(MLLM)不可或缺却尚未充分探索的能力。然而,现有图像审美评估(IAA)基准在感知范围狭窄或缺乏评估系统审美生产所需的多样性。为填补这一空白,我们引入 AesTest——一个涵盖多模态审美感知与生产的综合性基准,其主要特征如下:1)包含由精选多选题组成的十个任务,覆盖感知、欣赏、创作与摄影,基于生成式学习心理学理论;2)整合来自专业编辑工作流程、摄影构图教程及众包偏好的多源数据,既覆盖专家级原则,又涵盖真实世界差异;3)支持多种审美查询类型,包括属性分析、情感共鸣、构图选择与风格推理。我们在 AesTest 上评估了指令调优 IAA MLLM 与通用 MLLM,揭示了构建审美智能的诸多挑战。我们将公开释放 AesTest,以支持该领域后续研究。

关键词

引用

@article{arxiv.2511.06360,
  title  = {AesTest: Measuring Aesthetic Intelligence from Perception to Production},
  author = {Guolong Wang and Heng Huang and Zhiqiang Zhang and Wentian Li and Feilong Ma and Xin Jin},
  journal= {arXiv preprint arXiv:2511.06360},
  year   = {2025}
}

备注

10 pages, 9 figures