中文

跨语言低资源形态切分中数据驱动模型的泛化性

计算与语言 2022-04-12 v2

摘要

常见的模型评估设计通常聚焦于单语设定,即根据模型在单一数据集上的表现进行比较,而该数据集被假定能代表当前任务所有可能的数据。虽然对于大型数据集这或许合理,但在低资源场景下这一假设难以成立,因为数据收集中的人为因素可能产生离群数据集,从而使关于模型性能的结论带有偶然性。为解决这些问题,我们研究了跨语言低资源场景下的模型泛化性。以形态切分为测试用例,我们比较了三类具有不同参数化的宽泛模型,所用数据来自6个语系的11种语言。在每种实验设定中,我们首先在所有模型上于第一个数据集上进行评估,随后考察当引入同等规模的新的随机采样数据集、以及将训练好的模型应用于不同规模的未见测试集时,其性能的一致性。结果表明,模型泛化的程度取决于数据集的特征,而不一定严重依赖于数据集规模。在我们研究的特征中,训练集与测试集之间语素重叠比例以及平均每个词的语素数比例是最显著的两个因素。我们的发现建议,未来的工作应采用随机采样来构建不同规模的数据集,以便对模型评估作出更负责任的论断。

关键词

引用

@article{arxiv.2201.01845,
  title  = {Data-driven Model Generalizability in Crosslinguistic Low-resource Morphological Segmentation},
  author = {Zoey Liu and Emily Prud'hommeaux},
  journal= {arXiv preprint arXiv:2201.01845},
  year   = {2022}
}

备注

Published in TACL (https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00467/110437/Data-driven-Model-Generalizability-in)