中文

教育应用中的LLM提示评估

人工智能 2026-01-23 v1 计算与语言

摘要

随着大语言模型(LLM)在教育应用中的普及,越来越需要基于证据的方法来设计和评估产生个性化且符合教育教学目标的输出的LLM提示。本研究提出了一种通用、系统的方法,用于评估提示,通过分析结构化对话活动中LLM生成的后续问题来演示其有效性。设计并测试了六个提示模板。这些模板纳入了已建立的提示工程模式,每个提示都强调不同的教育策略。通过锦标赛式评估框架比较了这些提示模板,该框架可适用于其他教育应用。锦标赛采用Glicko2评级系统,由八位评委在三个维度上评估问题对:格式、对话支持和对学习者的适当性。数据来源于120次真实用户交互,涉及三个不同的教育部署。结果表明,与其他模板相比,单个与战略性阅读相关的提示在两两比较中获胜概率范围为81%至100%。该提示结合了persona和context manager模式,旨在支持如自主学习等元认知学习策略。该方法展示了教育技术研究人员如何系统性地评估和改进提示设计,使其从经验性的提示工程转向面向教育应用的证据基础提示开发。

关键词

引用

@article{arxiv.2601.16134,
  title  = {LLM Prompt Evaluation for Educational Applications},
  author = {Langdon Holmes and Adam Coscia and Scott Crossley and Joon Suh Choi and Wesley Morris},
  journal= {arXiv preprint arXiv:2601.16134},
  year   = {2026}
}