基于语言学最小对系统评估中文语言模型
计算与语言
2025-12-09 v2
摘要
我们提出了ZhoBLiMP,这是规模最大的中文语言学最小对基准,涵盖超过100种范式,从话题化到"把"字句。随后,我们从头训练了一套中文语言模型(LM),使用不同的分词器、参数规模和词表规模,以研究语言模型在中文上的学习曲线。为缓解最小对中句子长度不等所带来的偏差,我们提出了一种新的评估指标——次线性长度归一化对数概率(SLLN-LP)。使用SLLN-LP作为评估指标,我们的结果表明,即使对于参数高达32B的语言模型,中文中的照应(Anaphor)、量词(Quantifiers)和省略(Ellipsis)仍然难以正确处理,且SLLN-LP成功缓解了ZhoBLiMP、JBLiMP和BLiMP中的偏差。我们得出结论:未来的评估应当更加审慎地考虑连接函数、语言模型与目标最小对之间的复杂关系。
引用
@article{arxiv.2411.06096,
title = {A Systematic Assessment of Language Models with Linguistic Minimal Pairs in Chinese},
author = {Yikang Liu and Yeting Shen and Hongao Zhu and Lilong Xu and Zhiheng Qian and Siyuan Song and Kejia Zhang and Jialong Tang and Pei Zhang and Baosong Yang and Rui Wang and Hai Hu},
journal= {arXiv preprint arXiv:2411.06096},
year = {2025}
}
备注
Accepted by TACL