面向专业艺术绘画评估的大型视觉语言模型
计算机视觉与模式识别
2026-03-12 v1
摘要
尽管大型视觉语言模型(VLM)在一般视觉能力方面表现出惊人的能力,但它们仍然具有艺术盲区,无法在特定艺术领域内提供专业级的作品评估。为弥合这一差距,我们将 VLM 转化为能够进行专业水平绘画评估的专家,其评估范围覆盖中文艺术领域,该领域更为抽象,需经过大量艺术训练才能进行评估。我们引入 HanMo-Bench 数据集,包含真实拍卖级别的名家名作和 AI 生成的作品,基于真实市场评估。为实现严谨的判断,我们提出 HanMoVLM 并构建了经专家验证的链式思维(Chain-of-Thought, CoT)。该 CoT 指导模型执行专家级推理:从内容识别和感兴趣区域(RoI)定位到专业评估,依据主题特定评估和中文绘画的典型三级评估进行引导。此外,我们设计了奖励函数以优化 HanMoVLM 的推理过程,从而提高准确性。我们展示了 HanMoVLM 可作为测试时扩张(Test-time Scaling)关键 backbone 的作用。作为高质量验证器,HanMoVLM 使生成模型能够从多个候选输出中选择最具艺术性的输出。实验结果和人类研究均表明,所提出的 HanMoVLM 有效弥合了差距,与专业专家高度一致,显著提升了中文绘画生成质量。
引用
@article{arxiv.2603.10814,
title = {HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation},
author = {Hongji Yang and Yucheng Zhou and Wencheng Han and Songlian Li and Xiaotong Zhao and Jianbing Shen},
journal= {arXiv preprint arXiv:2603.10814},
year = {2026}
}
备注
14 pages