评估语言模型的语言泛化能力:一个巴西葡萄牙语数据集
计算与语言
2023-06-08 v2
摘要
近期大量工作致力于创建大规模语言模型。当前最突出的方法基于深度神经网络,如 BERT。然而,它们缺乏透明性与可解释性,常被视为黑盒。这不仅影响其在下游任务中的适用性,也影响不同架构甚至使用不同语料或超参数训练的同一模型之间的可比性。本文提出一组内在评估任务,用以考察为巴西葡萄牙语开发的模型中所编码的语言信息。这些任务旨在评估不同语言模型如何泛化与语法结构及多词表达式(MWE)相关的信息,从而能够评估模型是否学习了不同的语言现象。为这些任务开发的数据集由一系列含单个掩码词和一条帮助缩小上下文范围的提示短语的句子组成。该数据集分为 MWE 与语法结构两类,后者进一步细分为 6 项任务:非人称动词、主语一致、动词一致、名词一致、被动与连接词。MWE 子集用于测试 BERTimbau Large、BERTimbau Base 与 mBERT。对于语法结构,我们仅使用 BERTimbau Large,因其在 MWE 任务中取得了最佳结果。
引用
@article{arxiv.2305.14070,
title = {Assessing Linguistic Generalisation in Language Models: A Dataset for Brazilian Portuguese},
author = {Rodrigo Wilkens and Leonardo Zilio and Aline Villavicencio},
journal= {arXiv preprint arXiv:2305.14070},
year = {2023}
}
备注
This is the original manuscript that was submitted to LREV. The final version was published recently and can be found at: https://rdcu.be/ddEa6. Language Resources and Evaluation, https://doi.org/10.1007/s10579-023-09664-1