判别性思维还是通用辅导? 评估 Socratic LLMs 的指令引导能力
计算与语言
2025-09-30 v2 人工智能
摘要
大型语言模型的对话能力为实现可扩展且互动式的辅导提供了巨大潜力。虽然已有研究主要考察其生成 Socratic 提问的能力, 但常常忽视关键方面: 依据学习者的认知状态灵活引导。本研究超越问题生成, 强调指令引导能力。我们提出 GuideEval, 一个基于真实教育对话的基准, 通过三个阶段的行为框架评估教育引导: (1) 感知, 推断学习者状态; (2) 编排, 调整指令策略; (3) 激发, 激发正确反思。实证结果表明, 现有 LLMs 在学习者感到困惑或需要重新引导时, 往往难以提供有效的自适应支架。为补充定量评估, 我们进行详细的失败案例分析, 说明这些不足之处。此外, 我们引入一种基于行为提示的微调策略, 利用行为提示的指令对话, 显著提升了引导性能。通过从孤立内容评估转向以学习者为中心的状态感知交互, 本工作倡导更对话化的 Socratic LLMs 评估范式。
引用
@article{arxiv.2508.06583,
title = {Discerning minds or generic tutors? Evaluating instructional guidance capabilities in Socratic LLMs},
author = {Ying Liu and Can Li and Ting Zhang and Mei Wang and Qiannan Zhu and Jian Li and Hua Huang},
journal= {arXiv preprint arXiv:2508.06583},
year = {2025}
}