UNIAA:统一多模态图像美学评估基线与基准
计算机视觉与模式识别
2024-04-16 v1 人工智能
摘要
作为昂贵专家评估的替代方案,图像美学评估(IAA)已成为计算机视觉中的一项重要任务。然而,传统的 IAA 方法通常局限于单一数据源或任务,限制了其通用性和更广泛的应用。在这项工作中,为了更好地与人类美学相契合,我们提出了一个统一多模态图像美学评估(UNIAA)框架,包括一个名为 UNIAA-LLaVA 的多模态大语言模型(MLLM)和一个名为 UNIAA-Bench 的综合基准。我们选择兼具视觉感知和语言能力的 MLLM 来进行 IAA,并建立了一种低成本范式,将现有数据集转化为统一且高质量的视觉指令微调数据,UNIAA-LLaVA 即基于此进行训练。为了进一步评估 MLLM 的 IAA 能力,我们构建了 UNIAA-Bench,它包含三个美学层次:感知、描述和评估。大量实验验证了 UNIAA 的有效性和合理性。与现有的 MLLM 相比,UNIAA-LLaVA 在 UNIAA-Bench 的所有层次上均取得了具有竞争力的性能。具体而言,我们的模型在美学感知方面优于 GPT-4V,甚至接近初级水平的人类。我们发现 MLLM 在 IAA 方面具有巨大潜力,但仍有很大的进一步改进空间。UNIAA-LLaVA 和 UNIAA-Bench 将被发布。
引用
@article{arxiv.2404.09619,
title = {UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark},
author = {Zhaokun Zhou and Qiulin Wang and Bin Lin and Yiwei Su and Rui Chen and Xin Tao and Amin Zheng and Li Yuan and Pengfei Wan and Di Zhang},
journal= {arXiv preprint arXiv:2404.09619},
year = {2024}
}