推理模型能否理解中国古代文献中的数学问题?基于《算经》的实证研究
计算与语言
2025-06-16 v3 人工智能
摘要
本研究针对中文古代数学经典智能处理中的挑战,构建了以《算经》为基础的古典文献评估基准数据集Guji_MATH。系统评估了主流推理模型在古汉语独特语言约束下的数学问题解决能力。通过机器辅助标注和人工核查,共从8部经典文献中提取538道数学问题,形成以“问题-答案-解答”框架为中心的结构化数据集,并补充问题类型与难度等级。设计了闭卷模式(自主解题)和开卷模式(复现古典解答方法)两大评估模式,用于评估6种推理模型在古汉语数学问题上的表现。结果表明,推理模型能够部分理解并解决此类问题,但总体性能仍低于现代数学任务基准。应优先提升模型对古汉语的理解能力和文化知识。本研究为挖掘古代文献中的数学知识、传播传统文化提供了方法论支持,也为评估跨语言、跨文化推理模型能力提供了新视角。
引用
@article{arxiv.2505.16660,
title = {Can reasoning models comprehend mathematical problems in Chinese ancient texts? An empirical study based on data from Suanjing Shishu},
author = {Chang Liu and Dongbo Wang and Liu liu and Zhixiao Zhao},
journal= {arXiv preprint arXiv:2505.16660},
year = {2025}
}
备注
29pages, 7 figures