中文

LLM 在为智能辅导系统中的逻辑问题构建证明和提示方面的前景与局限

人工智能 2025-11-24 v2

摘要

智能教学系统在教授形式命题逻辑证明方面已展现出有效性,但它们对基于模板的解释的依赖限制了其提供个性化学生反馈的能力。虽然大型语言模型(LLMs)为动态反馈生成提供了有前景的能力,但它们存在产生幻觉或生成不符合教学法的解释的风险。我们评估了 LLM 在构建多步符号逻辑证明中的逐步准确性,在 358 个命题逻辑问题上比较了四种最先进的 LLM 的六种提示技术。结果表明,DeepSeek-V3 在逐步证明构建上取得了高达 86.7% 的准确率,表现优越,尤其在较简单的规则上表现出色。我们进一步使用性能最佳的 LLM 为来自一个逻辑 ITS 的 1,050 个独特的学生问题解决状态生成了解释性提示,并使用 LLM 评分器和人类专家评分在 20% 的样本上根据 4 个标准对其进行了评估。我们的分析发现,LLM 生成的提示准确率达到 75%,并且在一致性和清晰度方面获得了人类评估者的高度评价,但在解释为何提供该提示或其更大背景方面表现不佳。我们的结果表明,LLM 可用于增强教学系统的逻辑辅导提示,但需要额外的修改以确保准确性和教学适宜性。

关键词

引用

@article{arxiv.2505.04736,
  title  = {The promise and limits of LLMs in constructing proofs and hints for logic problems in intelligent tutoring systems},
  author = {Sutapa Dey Tithi and Arun Kumar Ramesh and Clara DiMarco and Xiaoyi Tian and Nazia Alam and Kimia Fazeli and Tiffany Barnes},
  journal= {arXiv preprint arXiv:2505.04736},
  year   = {2025}
}