CreativityBench:基于功能- affordance工具复用的智能体创造性推理评估
人工智能
2026-05-07 v2 计算与语言
机器学习
摘要
近期大语言模型的进展导致其在推理和环境交互任务上表现突出,但其创造性问题解决能力仍未得到充分探索。我们通过创造性工具使用视角研究此能力,其中模型通过推理对象功能- affordance和属性而非依赖规范用途来复用可用对象。作为第一步,我们引入CreativityBench——用于评估LLM功能- affordance创造性的基准。为此,我们构建了包含4K实体和150K+功能- affordance注释的大型功能- affordance知识库(KB),显式链接对象、部件、属性和可操作用途。基于该KB,我们生成14K个需在约束条件下识别非显而易见但物理上合理解决方案的任务。针对10个最先进的LLM(包括封闭式和开源模型)进行评估,结果显示模型常能选择合理对象,但难以识别正确部件、其功能- affordance以及解决任务所需的底层物理机制,从而导致性能显著下降。此外,模型规模的改进很快饱和,强大的通用推理并不一定可靠地转化为创造性功能- affordance发现,常见的推理时策略如链式思考仅带来有限提升。这些结果表明,创造性工具使用是当前模型面临的主要挑战之一,CreativityBench为研究这一智力维度提供了有用的测试平台,并对未来智能体的规划和推理模块具有潜在意义。
关键词
引用
@article{arxiv.2605.02910,
title = {CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing},
author = {Cheng Qian and Hyeonjeong Ha and Jiayu Liu and Jeonghwan Kim and Jiateng Liu and Bingxuan Li and Aditi Tiwari and Dwip Dalal and Zhenhailong Wang and Xiusi Chen and Mahdi Namazifar and Yunzhu Li and Heng Ji},
journal= {arXiv preprint arXiv:2605.02910},
year = {2026}
}
备注
57 Pages, 14 Tables, 27 Figures