CresOWLve:基于现实世界知识的创造性问题解决能力基准测试
计算与语言
2026-04-07 v1 人工智能
摘要
创造性问题解决需要结合多种认知能力,包括逻辑推理、横向思维、类比推理和常识知识,以发现连接看似无关信息的洞见。然而,现有的大多数大型语言模型 (large language models, LLMs) 基准测试仅评估此过程的特定组成部分。此外,许多面向创造力的基准测试依赖于人工构建的脑筋急转弯或人为设定的场景,这些并不能反映创造性问题解决在现实世界环境中的发生方式。为了弥补这一差距,我们引入了 CresOWLve,这是一个使用基于现实世界知识的谜题来评估创造性问题解决能力的基准测试。CresOWLve 中的问题需要运用多种创造性思维策略,从不同领域检索事实,并创造性地将它们结合起来以得出解决方案。通过评估多个前沿的非思维链和思维链 LLMs,我们表明 CresOWLve 仍然极具挑战性。我们的分析揭示了一致的性能差距:模型在事实性问题上的表现明显优于创造性问题(降幅高达 -17%)。虽然模型通常能够检索到相关知识,但它们难以形成整合这些信息并得出正确答案所需的非显而易见的创造性联系。
引用
@article{arxiv.2604.03374,
title = {CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge},
author = {Mete Ismayilzada and Renqing Cuomao and Daniil Yurshevich and Anna Sotnikova and Lonneke van der Plas and Antoine Bosselut},
journal= {arXiv preprint arXiv:2604.03374},
year = {2026}
}
备注
Under review