中文

评估大语言模型在提出数学问题新颖解法方面的创造力

计算与语言 2024-10-25 v1 人工智能

摘要

AI系统的数学能力是复杂且多方面的。现有研究大多主要关注AI系统生成的数学问题解答的正确性。在这项工作中,我们认为,除了生成正确答案之外,AI系统还应能够或协助人类开发数学难题的新颖解法。本研究探讨了大语言模型(LLMs)在数学推理中的创造力潜力,而这一方面在先前研究中受到的关注有限。我们引入了一个新颖的框架和基准测试——CreativeMath,其涵盖从中学课程到奥林匹克竞赛水平的问题,旨在评估LLMs在已知一些解法后提出创新解法的能力。我们的实验表明,尽管LLMs在标准数学任务上表现良好,但其创造性问题解决能力差异显著。值得注意的是,Gemini-1.5-Pro模型在生成新颖解法方面优于其他LLMs。这项研究开辟了评估AI创造力的新前沿,揭示了LLMs在促进数学创新方面的优势与局限,并为未来AI辅助数学发现的发展奠定了基础。

关键词

引用

@article{arxiv.2410.18336,
  title  = {Assessing the Creativity of LLMs in Proposing Novel Solutions to Mathematical Problems},
  author = {Junyi Ye and Jingyi Gu and Xinyun Zhao and Wenpeng Yin and Guiling Wang},
  journal= {arXiv preprint arXiv:2410.18336},
  year   = {2024}
}