预训练语言模型与人类语义关系知识的全面评估
计算与语言
2025-08-06 v5
摘要
近期大量研究关注于预训练语言模型(PLMs)究竟学习了语言的哪些方面,以及如何学习。其中一种研究方向探讨了PLMs关于语义关系的认知。然而,语义关系的许多方面仍未被探索。通常仅关注一种语义关系,即 超类关系(hypernymy)。此前的工作也未测量人类在相同任务上的表现。因此,目前仅能获得这些模型语义关系知识的不完整视图。为填补这一差距,我们引入一个覆盖除超类关系之外的五种语义关系的全面评估框架,包括 原类关系(hyponymy)、全称关系(holonymy)、 部分关系(meronymy)、反义关系(antonymy)和同义关系(synonymy)。我们使用五种指标(其中两种为本文新提出)来衡量语义关系知识的未被处理方面,包括 可靠性(soundness)、完整性(completeness)、对称性(symmetry)、原型性(prototypicality)和可区分性(distinguishability)。借助这些指标,我们能够在同一任务上对人类与模型进行公正比较。我们的大规模实验涉及六种 PLMs,其中四种为掩码语言模型,两种为因果语言模型。结果显示,针对所有语义关系,人类与模型之间存在显著的知识差距。总体而言,尽管因果语言模型广泛应用,但并不总是显著优于掩码语言模型。反义关系是唯一所有模型表现相对较好的语义关系。评估材料可在 https://github.com/hancules/ProbeResponses 找到。
引用
@article{arxiv.2412.01131,
title = {A Comprehensive Evaluation of Semantic Relation Knowledge of Pretrained Language Models and Humans},
author = {Zhihan Cao and Hiroaki Yamada and Simone Teufel and Takenobu Tokunaga},
journal= {arXiv preprint arXiv:2412.01131},
year = {2025}
}