中文

面向科学问答的提示链设计与评估

人机交互 2026-02-23 v2 计算与语言

摘要

大型语言模型正在重塑教育领域,学生越来越依赖它们进行学习。这些系统若基于通用模型实现,很可能会直接给出答案,从而可能损害概念理解与批判性思维。先前的研究表明,提示能够有效促进认知参与。基于这一见解,我们评估了18个开源大型语言模型在生成提示链方面的能力,这些提示链旨在引导用户逐步接近正确答案。我们比较了两种不同的提示策略:为每个问题预先生成的静态提示,以及根据学习者进度调整的动态提示。我们使用五个基于教学法的自动评估指标来衡量提示质量。以表现最佳的大型语言模型为基础,我们开展了一项包含41名参与者的定量研究,揭示了用户对不同提示策略的独特偏好,并指出了自动评估指标在捕捉这些偏好方面的局限性。我们的发现为未来关于辅导系统的研究提炼了关键设计考量,并有助于开发更以学习者为中心的教育技术。

关键词

引用

@article{arxiv.2510.21087,
  title  = {Designing and Evaluating Chain-of-Hints for Scientific Question Answering},
  author = {Anubhav Jangra and Smaranda Muresan},
  journal= {arXiv preprint arXiv:2510.21087},
  year   = {2026}
}