中文

什么塑造了一个有创造力的机器智能体?对基础模型创造力的全面基准测试

人工智能 2025-10-07 v1 计算与语言

摘要

基础模型(foundation models,FMs)的飞速发展使其能力范围远超传统任务。创造力,长期被视为人类智力的标志性特征,也是创新的驱动力,如今正被广泛视为生成式 FMs 时代的机器智能的关键维度,补充了传统准确性度量之外的衡量标准。然而,现有的创造力评估框架仍显碎片化,依赖的评估指标缺乏建立在既定理论基础之上的扎实依据。为此,我们提出 C^2-Eval,这是一个用于统一评估 FMs 创造力的全方位基准测试。C^2-Eval 区分了两种互补的创造力形式:收敛型创造力(例如代码生成),其中任务具有受限的解空间;以及发散型创造力(例如讲故事),其中任务开放性更大。它通过源自社会科学理论的细粒度标准,对这两种维度进行评估,聚焦于实用性(Usefulness)、原创性(Originality)和惊讶性(Surprise)三大指标。通过在主流专有和开源模型上进行大规模实验,我们分析了这些模型在创造能力之间的权衡。我们的结果表明,当前的 FMs 在追求创造机器智能的道路上既有优势也面临挑战,显示示 C^2-Eval 是审视创意 AI 不断演变的有效之窗。

关键词

引用

@article{arxiv.2510.04009,
  title  = {What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models},
  author = {Zicong He and Boxuan Zhang and Weihao Liu and Ruixiang Tang and Lu Cheng},
  journal= {arXiv preprint arXiv:2510.04009},
  year   = {2025}
}

备注

22 pages