中文

多模态 LLM 能在零样态中进行审美推理

计算机视觉与模式识别 2025-09-03 v3 人工智能 计算与语言 多媒体

摘要

生成式艺术(GenArt)的快速技术进步使视觉吸引力的图像创建民主化,但实现真正的艺术影响——即与观众在更深层次上产生共鸣的效果——仍然具有挑战性,因为这需要精细的审美洞察力。这种洞察力涉及超越单纯视觉吸引力的多层次认知过程,而当前的计算方法往往忽视了这一点。本文 pioneering 地提出一种方法,通过研究多模态 LLM(MLLM)的推理能力如何有效地执行审美判断。我们的分析揭示了一个关键挑战:在审美推理过程中,MLLM 存在迷惑现象,表现为主观意见和无依据的艺术解释。我们进一步展示,这些迷惑可以通过采用基于证据且客观的推理过程来抑制,具体而言,通过我们提出的基准方法 ArtCoT 实现。受此原则启发的 MLLM 能够产生多层次、深入的审美推理,与人类判断的一致性显著提高。这些发现直接应用于 AI 艺术辅导和图像生成的奖励模型。最终,我们希望本工作为开发能够真正理解、欣赏并与人类审美价值相吻合的艺术作品的 AI 系统铺路。项目主页: https://github.com/songrise/MLLM4Art。

关键词

引用

@article{arxiv.2501.09012,
  title  = {Multimodal LLMs Can Reason about Aesthetics in Zero-Shot},
  author = {Ruixiang Jiang and Changwen Chen},
  journal= {arXiv preprint arXiv:2501.09012},
  year   = {2025}
}

备注

ACM MM 2025 Camera Ready