中文

基于显著性增强多模态大语言模型的审美图像描述

计算机视觉与模式识别 2025-09-10 v3

摘要

审美图像描述 (AIC) 旨在生成关于图像美学的文本描述,已成为计算美学领域的一个关键研究方向。近年来,预训练多模态大语言模型 (MLLMs) 发展迅速,导致融合视觉和文本模态的图像美学研究显著增加。然而,现有的大多数图像美学研究主要集中于预测美学评分,在 AIC 中的应用有限。现有的利用 MLLMs 的 AIC 工作主要依赖微调方法,而没有专门调整 MLLMs 以聚焦于目标美学内容。为了解决这一局限性,我们提出了美学显著性增强多模态大语言模型 (ASE-MLLM),这是一个端到端框架,明确地将美学显著性融入 MLLMs。在此框架内,我们引入了图像美学显著性模块 (IASM),该模块能高效且有效地从图像中提取美学显著性特征。此外,我们设计了 IAS-ViT 作为 MLLMs 的图像编码器,该模块通过交叉注意力机制将美学显著性特征与原始图像特征融合。据我们所知,ASE-MLLM 是首个将图像美学显著性集成到 MLLMs 中专门用于 AIC 任务的框架。大量实验表明,我们的方法在当前主流的 AIC 基准上显著优于传统方法和通用 MLLMs,达到了最先进的 (SOTA) 性能。

关键词

引用

@article{arxiv.2509.04378,
  title  = {Aesthetic Image Captioning with Saliency Enhanced MLLMs},
  author = {Yilin Tao and Jiashui Huang and Huaze Xu and Ling Shao},
  journal= {arXiv preprint arXiv:2509.04378},
  year   = {2025}
}