中文

哪些问题最能促进学习?基于语言模型模拟的问题效用估计

计算与语言 2025-08-08 v2

摘要

提出好问题对于理解和学习至关重要,然而评估和生成此类问题仍是一个具有挑战性的难题。先前关于探究性问题的研究侧重于学习者生成的、由好奇心驱动的提问,并使用间接指标(如显著性或信息增益)对其进行评估,而这些指标并不能直接反映问题对实际学习成果的影响。我们引入了 QUEST(Question Utility Estimation with Simulated Tests,基于模拟测试的问题效用估计),这是一个利用语言模型模拟学习者并直接量化问题效用(即其对考试表现贡献)的框架。QUEST 模拟一名学习者在学习教科书章节时提出问题并获取答案,随后利用这些内容参加章末考试。通过这种模拟,每个问题的效用是通过其对考试表现的直接影响来估计的,而不是基于底层内容进行间接推断。为了支持这种评估,我们构建了 TEXTBOOK-EXAM 基准,该基准将五个学科的教科书章节与章末考试问题相对齐。利用 QUEST,我们筛选出高效用问题,并通过拒绝采样微调问题生成器。实验表明,与使用间接指标微调或利用提示方法的强基线相比,由 QUEST 训练模型生成的问题将模拟考试分数提高了 20% 以上。此外,效用与显著性及与考试问题的相似性仅呈弱相关,这表明它捕捉到了有利于下游性能的独特信号。QUEST 为问题评估和生成提供了一种新的结果驱动范式——它超越了问答内容,转向学习成果的可衡量改进。

关键词

引用

@article{arxiv.2502.17383,
  title  = {Which Questions Improve Learning the Most? Utility Estimation of Questions with LM-based Simulations},
  author = {Dong-Ho Lee and Hyundong Cho and Jonathan May and Jay Pujara},
  journal= {arXiv preprint arXiv:2502.17383},
  year   = {2025}
}

备注

17 pages, 5 figures, 6 tables