中文

利用大语言模型识别知识组件

计算与语言 2025-11-14 v1 人机交互

摘要

知识组件(KCs)是自适应学习系统的基础,但其由领域专家手动识别是巨大的瓶颈。虽然大语言模型(LLM)为自动化这一过程提供了可行的途径,但现有研究受限于小型数据集且被证明会产生冗余、不必要的KC标签。本研究通过将规模化的“模拟教科书”LLM提示策略(使用GPT-4o-mini)扩展到646个多选题的数据集来克服这些限制。我们发现,这一初始自动化方法的性能显著低于专家设计的KC模型(RMSE为0.4285 vs. 0.4206),且生成的KC数量过多(569 vs. 101)。为解决冗余问题,我们提出并评估了一种基于余弦相似度合并语义相似KC标签的新方法。该合并策略显著改善了模型性能;采用余弦相似度阈值为0.8的模型取得最佳结果,将KC数量减少到428,RMSE降至0.4259。这表明尽管规模化的LLM生成单独不足以实现自动化,但将其与语义合并技术相结合为自动化和细化KC识别提供了可行的路径。

关键词

引用

@article{arxiv.2511.09935,
  title  = {Leveraging Large Language Models for Identifying Knowledge Components},
  author = {Canwen Wang and Jionghao Lin and Kenneth R. Koedinger},
  journal= {arXiv preprint arXiv:2511.09935},
  year   = {2025}
}

备注

Accepted as an extended abstract in The International Conference on Learning Analytics & Knowledge (LAK'25) Workshop: LLMs for Qualitative Analysis in Education