I-RAVEN-X:评估大语言模型与大推理模型中类比与数学推理泛化与鲁棒性的基准
机器学习
2025-11-03 v2 人工智能
摘要
我们提出 I-RAVEN-X,一个用于评估大语言模型(LLMs)和大推理模型(LRMs)中类比与数学推理泛化性与鲁棒性的符号基准测试。I-RAVEN-X 通过增加操作数复杂度、属性范围,并引入感知不确定性,扩展了 I-RAVEN。与传统 LLM 相比,实验结果表明 LRM 在更长的推理关系和更广的属性范围上实现了更好的生产力和系统性。然而,LRM 在面对不确定性下的推理仍受挑战,无法有效探索多个概率性结果。
引用
@article{arxiv.2510.17496,
title = {I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models},
author = {Giacomo Camposampiero and Michael Hersche and Roger Wattenhofer and Abu Sebastian and Abbas Rahimi},
journal= {arXiv preprint arXiv:2510.17496},
year = {2025}
}
备注
Accepted at the 5th Workshop on Mathematical Reasoning and AI (MATH-AI), NeurIPS 2025