CreBench:从创意到过程再到产品的人类对齐创造力评估
人工智能
2025-11-18 v1
摘要
人类定义的创造力高度抽象,这对多模态大语言模型(MLLMs)理解和评估与人类判断相符的创造力构成了挑战。现有基准的缺失进一步加剧了这一困境。为此,我们提出了 CreBench,它包含两个关键组成部分:1)一个覆盖从创意构思到创作过程再到最终产品等多个维度的评估基准;2)CreMIT(创造力多模态指令微调数据集),这是一个多模态创造力评估数据集,包含 2.2K 个来源多样的多模态数据、79.2K 条人类反馈和 4.7M 条多类型指令。具体来说,为确保 MLLMs 能够处理各种与创造力相关的查询,我们提示 GPT 精炼这些人类反馈,以激活更强的创造力评估能力。CreBench 为构建理解人类对齐创造力的 MLLMs 奠定了基础。基于 CreBench,我们对开源的通用 MLLMs 进行微调,得到了 CreExpert,一个多模态创造力评估专家模型。大量实验表明,与最先进的 MLLMs(包括最先进的 GPT-4V 和 Gemini-Pro-Vision)相比,所提出的 CreExpert 模型在评估上与人类创造力判断实现了显著更好的对齐。
引用
@article{arxiv.2511.13626,
title = {CreBench: Human-Aligned Creativity Evaluation from Idea to Process to Product},
author = {Kaiwen Xue and Chenglong Li and Zhonghong Ou and Guoxin Zhang and Kaoyan Lu and Shuai Lyu and Yifan Zhu and Ping Zong Junpeng Ding and Xinyu Liu and Qunlin Chen and Weiwei Qin and Yiran Shen and Jiayi Cen},
journal= {arXiv preprint arXiv:2511.13626},
year = {2025}
}
备注
13 pages, 3 figures,The 40th Annual AAAI Conference on Artificial Intelligence(AAAI 2026),Paper has been accepted for a poster presentation