语言瓶颈模型用于定性知识状态建模
计算与语言
2026-02-10 v2 人工智能
机器学习
摘要
准确评估学生知识是教育的核心环节。认知诊断(CD)模型估计学生在固定时间点的熟练程度,而知识追踪(KT)方法则建模演化中的知识状态以预测未来表现。然而,现有方法要么提供有限表达能力的定量概念掌握估计(CD、概率KT),要么在可解释性方面牺牲预测精度(深度学习KT)。我们提出语言瓶颈模型(LBMs),其中编码器大语言模型生成文本知识状态摘要,解码器大语言模型据此预测未来表现。这产生可解释的摘要,能够捕捉CD和KT模型无法捕捉的诸如误解等细致洞察。广泛的实验在合成数据和真实数据集上的验证表明,LBMs揭示了CD和KT模型所能捕捉的定性洞察,同时在样本效率方面实现了与现有方法相当的准确率。我们展示了编码器和解码器可以分别通过强化学习和监督微调进行微调,以提高摘要质量和预测性能。
引用
@article{arxiv.2506.16982,
title = {Language Bottleneck Models for Qualitative Knowledge State Modeling},
author = {Antonin Berthon and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2506.16982},
year = {2026}
}