首次见到 $a^2+b^2=c^2$ 时会提出什么问题?评估 LLM 在好奇驱动的提问方面的能力
计算与语言
2025-07-09 v2 人工智能
机器学习
摘要
大型语言模型(LLM)能够存储大量知识,但其获取新知识的潜力尚未为人所知。我们提出了一种新型评估框架来评估这一能力。该框架提示 LLM 对引入科学知识的陈述生成问题,模拟当人类首次面对该陈述时的好奇心。我们对生成问题的质量进行评分,从而评估 LLM 的知识获取潜力。我们对评分程序进行受控消除实验以进行验证。此外,我们创建了一个由1101个物理、化学和数学陈述组成的合成数据集,其中包含不同难度级别,300个常识性陈述,以及567个错误陈述。进行了人类评估以验证模型评估,所有三个被考量的指标上的加权 Cohen's Kappa 约为0.7。我们发现,尽管大型模型如 GPT-4 和 Mistral 8x7b 擅长生成连贯且相关的问题,但较小的 Phi-2 模型同样或更有效。这表明模型大小并不唯一决定其知识获取潜力。该提出框架量化了常被忽视的关键模型能力,为开发更具知识性的 AI 系统开辟了研究机遇。
引用
@article{arxiv.2409.17172,
title = {What Would You Ask When You First Saw $a^2+b^2=c^2$? Evaluating LLM on Curiosity-Driven Questioning},
author = {Shashidhar Reddy Javaji and Zining Zhu},
journal= {arXiv preprint arXiv:2409.17172},
year = {2025}
}