TheoremQA:一个定理驱动的问答数据集
计算与语言
2023-12-07 v3 人工智能
摘要
近期,GPT-4 和 PaLM-2 等 LLM(大语言模型)在解决 GSM8K 等基础数学问题上取得了巨大进展,准确率超过 90%。然而,它们在解决需要领域特定知识(即定理)的更具挑战性的数学问题方面的能力尚待研究。本文介绍了 TheoremQA,这是首个定理驱动的问答数据集,旨在评估 AI 模型应用定理解决挑战性科学问题的能力。TheoremQA 由领域专家策划,包含 800 道高质量问题,涵盖来自数学、物理、电子电气与计算机科学(EE&CS)和金融的 350 个定理(如泰勒定理、拉格朗日定理、霍夫曼编码、量子定理、弹性定理等)。我们使用 Chain-of-Thoughts 和 Program-of-Thoughts 等不同提示策略,对 16 个大语言与代码模型进行了广泛评估。我们发现 GPT-4 解决这些问题的能力无与伦比,使用 Program-of-Thoughts Prompting 达到 51% 的准确率。所有现有的开源模型均低于 15%,勉强超过随机猜测基线。鉴于 TheoremQA 的多样性和广泛覆盖,我们认为它可作为更好的基准来评估 LLM 解决挑战性科学问题的能力。数据和代码发布于 https://github.com/wenhuchen/TheoremQA。
引用
@article{arxiv.2305.12524,
title = {TheoremQA: A Theorem-driven Question Answering dataset},
author = {Wenhu Chen and Ming Yin and Max Ku and Pan Lu and Yixin Wan and Xueguang Ma and Jianyu Xu and Xinyi Wang and Tony Xia},
journal= {arXiv preprint arXiv:2305.12524},
year = {2023}
}
备注
Accepted to Main Conference of EMNLP 2023