中文

求解X及更多:大型语言模型能否解决含两个以上未知数的复杂数学问题?

人工智能 2024-11-19 v1 计算与语言 机器学习

摘要

大型语言模型(LLMs)在解决数学问题方面展现了卓越的性能,这是人类智能的一个标志。然而,尽管在当前基准测试中取得了高成功率,但这些基准测试通常只包含含有一个或两个未知数的简单问题,不足以挑战其推理能力。本文引入了一个新的基准测试BeyondX,旨在通过纳入含多个未知数的问题来弥补这些局限性。认识到从头开始提出多未知数问题的挑战,我们使用一种创新的自动化流程开发了BeyondX,该流程通过扩展简单问题中的未知数数量来逐步增加复杂度。在BeyondX上的实证研究表明,现有LLMs(即使是那些专门针对数学任务进行微调的模型)的性能随着未知数数量的增加而显著下降——在GPT-4中观察到性能下降高达70%。为了应对这些挑战,我们提出了“公式化与求解”策略,这是一种通用的提示方法,能够有效处理任意数量未知数的问题。我们的研究结果表明,该策略不仅提升了LLMs在BeyondX基准测试上的性能,还提供了关于LLMs在面对更复杂数学挑战时计算极限的更深入见解。

关键词

引用

@article{arxiv.2407.05134,
  title  = {Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?},
  author = {Kuei-Chun Kao and Ruochen Wang and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2407.05134},
  year   = {2024}
}