KidsArtBench:基于属性感知 MLLM 的多维儿童艺术评估
人工智能
2025-12-16 v1
摘要
多模态大语言模型(MLLM)在众多视觉语言任务上取得显著进展;然而其在评估艺术表达方面的能力仍受限。审美概念本质上是抽象且开放的,多模态艺术注释稀缺。我们引入 KidsArtBench,一个包含 1000 多件 5-15 岁儿童艺术品的基准数据集,由 12 位专职教育工作者横跨 9 个评估维度进行标注,并附带专家评论以提供反馈。与以往针对成年观众图像提供单一标量评分的艺术数据集不同,KidsArtBench 针对儿童艺术品,搭配多维标注与评论监督,旨在实现有序评估和形成性反馈。基于这一资源,我们提出一种属性特定的多 LoRA 方法,其中每个属性对应评分量表中的一个独立评估维度(如写实性、想象力),并采用 Regression-Aware Fine-Tuning(RAFT)对预测结果进行调校,以匹配有序尺度。在 Qwen2.5-VL-7B 上的实验表明,我们的方法将相关系数从 0.468 提升至 0.653,尤其在感知维度上获得最大提升,在更高阶属性上缩小了差距。这些结果表明,教育工作者对齐的监督和属性感知的训练能够产生教育意义的评估,并为持续进步中的教育 AI 建立严谨的测试基准。我们发布数据和代码,并附带伦理文件。
引用
@article{arxiv.2512.12503,
title = {KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs},
author = {Mingrui Ye and Chanjin Zheng and Zengyi Yu and Chenyu Xiang and Zhixue Zhao and Zheng Yuan and Helen Yannakoudakis},
journal= {arXiv preprint arXiv:2512.12503},
year = {2025}
}