中文

HumanAesExpert:面向人类图像美学评估的多模态基础模型

计算机视觉与模式识别 2025-05-29 v2 人工智能

摘要

图像美学评估(IAA)是长期且具有挑战性的研究任务。然而,其子任务——人类图像美学评估(HIAA)鲜有被探索。为弥合这一研究空白,我们的工作为 HIAA 开辟了一套完整的实现框架。具体而言,我们引入 HumanBeauty,这是首个专为 HIAA 设计的数据集,包含 108k 张高质量的人类图像,并进行了手动标注。为实现对 HIAA 的全面且细粒度评估,我们通过严格的筛选流程收集了 50k 张人类图像进行手动标注,借助我们领先的 12 维美学标准进行标注;其余 58k 张图片则从公开数据集中系统筛选出并标注整体美学标签。基于 HumanBeauty 数据集,我们提出 HumanAesExpert,这是一个强大的视觉语言模型,用于人类图像的美学评估。我们创新性地设计了 Expert 头,融合了人类对美学子维度的认知,同时联合利用语言模型(LM)和回归头,从而使模型在整体和细粒度 HIAA 方面均具备卓越的评估能力。此外,我们引入 MetaVoter,将三个头的评分进行聚合,以有效平衡各头的能力,从而实现更精准的评估。大量实验表明,HumanAesExpert 在 HIAA 上显著优于其他最先进模型。项目网页:https://humanaesexpert.github.io/HumanAesExpert/。

关键词

引用

@article{arxiv.2503.23907,
  title  = {HumanAesExpert: Advancing a Multi-Modality Foundation Model for Human Image Aesthetic Assessment},
  author = {Zhichao Liao and Xiaokun Liu and Wenyu Qin and Qingyu Li and Qiulin Wang and Pengfei Wan and Di Zhang and Long Zeng and Pingfa Feng},
  journal= {arXiv preprint arXiv:2503.23907},
  year   = {2025}
}