中文

数学两位一:测试语言模型在交互中的涌现数学推理能力

人工智能 2026-04-27 v1 机器学习

摘要

虽然语言模型在数学基准测试中表现卓越,但是否体现真正的数学推理,或仅是对形式语法学习的统计模式匹配,仍不明确。大多数现有评估依赖于基于既定数学惯例的符号问题,限制了对模型从头构建抽象概念能力的洞察。本文提出Math Takes Two—a全新的基准测试,旨在评估通过交互涌现的数学推理能力。我们受人类数学认知与精确交互需求共演假设启发,测试两个无先天数学知识的智能体能否通过协作开发共享符号协议,以解决视觉 grounding 任务——其中数值系统有助于外推。不同于当前众多数据集,本基准不设预定义数学语言,要求智能体从头发现潜在结构与表征。Math Takes Two为发展和评估具涌现数理推理能力的模型提供了新视角。

关键词

引用

@article{arxiv.2604.21935,
  title  = {Math Takes Two: A test for emergent mathematical reasoning in communication},
  author = {Michael Cooper and Samuel Cooper},
  journal= {arXiv preprint arXiv:2604.21935},
  year   = {2026}
}

备注

Accepted at HCAIR workshop, ICLR 2026