评估NLP嵌入模型处理学生文本中科学特定符号表达的能力
计算与语言
2025-10-23 v2 人工智能
物理教育
摘要
近年来,自然语言处理(NLP)已成为教育数据挖掘的重要组成部分,特别是在分析学生生成的语言产品方面。为了研究和评估目的,通常使用所谓的嵌入模型来生成文本的数值表示,以捕捉其语义内容用于后续的定量分析。然而,当涉及科学相关语言时,方程和公式等符号表达引入了当前嵌入模型难以应对的挑战。现有的研究和实际应用常常要么忽视这些挑战,要么完全移除符号表达,这可能导致有偏的研究发现和实际应用性能下降。因此,本研究探讨了当代嵌入模型在处理和解释科学相关符号表达方面的差异。为此,我们使用来自真实学生回答的物理特定符号表达来评估各种嵌入模型,性能通过两种方法评估:1)基于相似性的分析;2)集成到机器学习流水线中。我们的结果揭示了模型性能的显著差异,OpenAI的GPT-text-embedding-3-large优于所有其他被评估模型,但其优势是中等而非决定性的。总体而言,本研究强调了教育数据挖掘研究者和实践者在处理包含符号表达的科学相关语言产品时仔细选择NLP嵌入模型的重要性。代码和(部分)数据可在 https://doi.org/10.17605/OSF.IO/6XQVG 获取。
引用
@article{arxiv.2505.17950,
title = {Evaluating NLP Embedding Models for Handling Science-Specific Symbolic Expressions in Student Texts},
author = {Tom Bleckmann and Paul Tschisgale},
journal= {arXiv preprint arXiv:2505.17950},
year = {2025}
}