中文

用于图像美学评估的多模态可学习查询

计算机视觉与模式识别 2024-05-03 v1

摘要

随着社交媒体的普及,图像美学评估(IAA)正吸引着广泛的兴趣。由于其主观且模糊的性质,该问题极具挑战性。与其仅从图像中直接提取美学特征,与图像关联的用户评论可能提供对 IAA 有用的互补知识。随着现有大规模预训练模型在提取高质量可迁移视觉和文本特征方面展现出强大能力,可学习查询已被证明在从预训练视觉特征中提取有用特征方面非常有效。因此,在本文中,我们提出了 MMLQ,它利用多模态可学习查询从多模态预训练特征中提取与美学相关的特征。大量实验结果表明,MMLQ 在多模态 IAA 上实现了新的 SOTA 性能,在 SRCC 和 PLCC 指标上分别比以往方法高出 7.7% 和 8.3%。

关键词

引用

@article{arxiv.2405.01326,
  title  = {Multi-modal Learnable Queries for Image Aesthetics Assessment},
  author = {Zhiwei Xiong and Yunfan Zhang and Zhiqi Shen and Peiran Ren and Han Yu},
  journal= {arXiv preprint arXiv:2405.01326},
  year   = {2024}
}

备注

Accepted by ICME2024