超越模式匹配的学习?评估LLM的数学理解能力
人工智能
2024-05-27 v1 计算与语言
机器学习
摘要
我们开始看到语言模型辅助科学发现的进展。受LLM作为通用科学助手的启发,本文通过LLM对解决数学问题所需的不同数学技能的理解来评估其领域知识。特别地,我们不仅关注预训练模型已知的内容,还关注它如何通过利用数学中复杂的知识结构,在上下文学习或指令微调中从信息中学习。受神经正切核(NTK)启发,我们提出\textit{NTKEval}来评估LLM在不同数学数据训练下概率分布的变化。我们的系统分析发现了上下文学习期间领域理解的证据。相比之下,某些指令微调导致不同数据训练下的性能变化相似,表明缺乏跨不同技能的领域理解。
引用
@article{arxiv.2405.15485,
title = {Learning Beyond Pattern Matching? Assaying Mathematical Understanding in LLMs},
author = {Siyuan Guo and Aniket Didolkar and Nan Rosemary Ke and Anirudh Goyal and Ferenc Huszár and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2405.15485},
year = {2024}
}