中文

借助LLM模拟新手构建教学对话数据

人工智能 2026-02-05 v2

摘要

高质量的多轮教学对话(在新手和专家之间)对于开发支持教学、学习和决策的AI系统至关重要。这些对话常涉及scaffolding——即专家通过提问、反馈和逐步指导来支持新手思维的过程。然而,由于隐私顾虑和help-seeking的脆弱性,这类数据稀缺。我们提出SimInstruct,一个可扩展的、专家在环的工具,用于收集scaffolding对话。我们以教学发展 coaching 为例,SimInstruct通过LLM模拟具有不同教学挑战和LLM人格特征的新手教学者,而人类专家提供多轮反馈、推理和教学支持。这种设计无需真实新手参与即可创建逼真且教育性丰富的对话。我们的结果表明,人格特征(如外向与内向)会显著影响专家的互动方式。与真实的导师录音相比,SimInstruct对话在教育相关性和认知深度方面表现相当。专家也表示,该过程既有趣又有反思性,显著提升了数据质量以及专家自身的专业洞察力。我们进一步微调LLaMA模型以成为专家模型,该模型在教学质量方面优于GPT-4o。我们的分析揭示了GPT-4o在弱反思性提问、过度使用泛泛赞美、语气轻视以及压倒性地向新手提供过多建议方面的局限性。

关键词

引用

@article{arxiv.2508.04428,
  title  = {Building Scaffolding Dialogue Data with LLM-Simulated Novices},
  author = {Si Chen and Izzy Molnar and Ting Hua and Peiyu Li and Le Huy Khiem and G. Alex Ambrose and Jim Lang and Ronald Metoyer and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:2508.04428},
  year   = {2026}
}