日本儿童谜语作为机器洞察力和元认知基准测试
人工智能
2026-01-06 v2
摘要
基准测试的饱和度和污染掩盖了大型语言模型(LLM)在推理方面的真实进展。我们引入了 NazoNazo 基准测试,这是一个低成本、可更新的测试,基于日本儿童谜语,要求进行基于洞察的推理,即表征性转移,而不仅仅是知识回忆。我们在201个谜语上评估了38个前沿LLM(2023-2025),并设置了一个120题的人类比较子集,发现非推理模型平均为7.6%,推理模型为17.6%,而人类约为53%。重要的是,思维-日志分析揭示了日本语中的推理并未必然提高准确率,表明语言理解本身不足以实现洞察推理。值得注意的是,模型有时会生成正确的备选答案,但未能认可这些答案,这表明是元认知控制 weakness 而非知识缺乏。这种“验证失败”表明CoT输出可能反映出真实的中间推理状态,而非事后事后合理化。在暴露了这一元认知瓶颈——模型无法识别自己何时正确——后,基准测试提供了一个可扩展的跨语言测试平台,用于研究机器洞察力、置信度校准和自我评估。因此,NazoNazo 基准测试不仅为当前LLM提供了新的挑战,也为开发AI元认知心理学和提升机器Aha!能力提供了具体目标。
引用
@article{arxiv.2509.14704,
title = {Japanese Children's Riddles as a Benchmark for Machine Insight and Metacognition},
author = {Masaharu Mizumoto and Dat Nguyen and Zhiheng Han and Jiyuan Fang and Heyuan Guan and Xingfu Li and Naoya Shiraishi and Yo Nakawake and Le Minh Nguyen},
journal= {arXiv preprint arXiv:2509.14704},
year = {2026}
}