MALAMUTE:面向多语言、高细粒度、无模板化的教育类探针数据集
计算与语言
2025-05-27 v2
摘要
语言模型(LMs)在各类领域取得了优异成绩。然而,为确保其在实际教育场景中的安全有效集成,必须证明其在具体、细粒度知识领域的熟练程度。现有基于掩码填充式基准测试(常用于评估LMs知识)存在三个主要局限性:1)不涵盖教育领域;2)通常聚焦于低复杂度、通用知识或宽泛领域,无法充分评估模型在特定学科的知识;3)常依赖模板,这可能偏向模型预测。为此,我们引入MALAMUTE,一个多语言、无模板化且高度细粒度的探针数据集,由专家编写、同行评审的探针组成,来自71部大学水平教科书,覆盖三种语言(英语、西班牙语和波兰语)。MALAMUTE是首个教育类掩码填充式数据集。其细粒度、教育导向特性以及句子级和段落级提示的包含,使其成为评估LMs课程相关知识的理想工具。我们对掩码和因果语言模型在MALAMUTE上的评估显示,尽管整体表现熟练,但在细致的特定学科考试中仍存在显著知识缺口,这阻碍其在课堂中安全使用,凸显了进一步发展的必要性。
引用
@article{arxiv.2412.10105,
title = {MALAMUTE: A Multilingual, Highly-granular, Template-free, Education-based Probing Dataset},
author = {Sagi Shaier and George Arthur Baker and Chiranthan Sridhar and Lawrence E Hunter and Katharina von der Wense},
journal= {arXiv preprint arXiv:2412.10105},
year = {2025}
}
备注
Accepted to ACL Findings 2025