中文

AesBench:面向图像美学感知的多模态大语言模型专家基准

计算机视觉与模式识别 2024-01-17 v1 计算与语言

摘要

在集体努力下,多模态大语言模型(MLLM)正在蓬勃发展。然而,它们在图像美学感知方面的表现仍不确定,而这在现实应用中非常需要。一个明显的障碍是缺乏专门的基准来评估MLLM在美学感知上的有效性。这种盲目摸索可能会阻碍具有美学感知能力的更先进MLLM的进一步发展。为了解决这一困境,我们提出了AesBench,一个专家基准,旨在通过双方面的精心设计全面评估MLLM的美学感知能力。(1)我们构建了一个专家标注的美学感知数据库(EAPD),该数据库具有多样化的图像内容和由专业美学专家提供的高质量标注。(2)我们提出了一套综合标准,从四个角度衡量MLLM的美学感知能力,包括感知(AesP)、共情(AesE)、评估(AesA)和解释(AesI)。广泛的实验结果表明,当前的MLLM仅具备初级的美学感知能力,MLLM与人类之间仍存在显著差距。我们希望这项工作能激励社区对MLLM的美学潜力进行更深入的探索。源数据将在https://github.com/yipoh/AesBench提供。

关键词

引用

@article{arxiv.2401.08276,
  title  = {AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception},
  author = {Yipo Huang and Quan Yuan and Xiangfei Sheng and Zhichao Yang and Haoning Wu and Pengfei Chen and Yuzhe Yang and Leida Li and Weisi Lin},
  journal= {arXiv preprint arXiv:2401.08276},
  year   = {2024}
}