AesExpert:面向图像美学感知的多模态基础模型
计算机视觉与模式识别
2024-07-25 v3
摘要
图像美学感知(IAP)的高度抽象性给当前多模态大语言模型(MLLM)带来了巨大挑战。缺乏人类标注的多模态美学数据进一步加剧了这一困境,导致 MLLM 在美学感知能力方面存在不足。为了应对上述挑战,我们首先引入了一个全面标注的美学多模态指令微调(AesMMIT)数据集,该数据集作为构建多模态美学基础模型的基石。具体而言,为了使 MLLM 与人类美学感知对齐,我们构建了一个语料丰富的美学评论数据库,包含 21,904 张来源多样的图像和 88K 条人类自然语言反馈,这些反馈是通过从粗粒度美学评级到细粒度美学描述的渐进式问题收集的。为了确保 MLLM 能够处理多样化的查询,我们进一步利用 GPT 精炼美学评论,并组装了大规模美学指令微调数据集,即 AesMMIT,它包含 409K 条多类型指令,以激活更强的美学能力。基于 AesMMIT 数据库,我们微调了开源的通用基础模型,得到了多模态美学专家模型,称为 AesExpert。大量实验表明,所提出的 AesExpert 模型的美学感知性能显著优于当前最先进的 MLLM,包括最先进的 GPT-4V 和 Gemini-Pro-Vision。项目主页:https://yipoh.github.io/aes-expert/。
引用
@article{arxiv.2404.09624,
title = {AesExpert: Towards Multi-modality Foundation Model for Image Aesthetics Perception},
author = {Yipo Huang and Xiangfei Sheng and Zhichao Yang and Quan Yuan and Zhichao Duan and Pengfei Chen and Leida Li and Weisi Lin and Guangming Shi},
journal= {arXiv preprint arXiv:2404.09624},
year = {2024}
}
备注
Accepted by ACMMM24