影响语言无关模型的因素的实证研究
计算与语言
2020-01-01 v1 机器学习
摘要
将现有应用与解决方案扩展到多种人类语言传统上一直颇为困难,这主要归因于传统方法中所采用的预处理与特征工程技术的语言依赖性。在本工作中,我们基于多语言表示,对影响语言无关模型的因素(包括任务类型、语言集合与数据资源)进行了实证研究。在两项最具代表性的自然语言处理任务——句子分类与序列标注上,我们表明语言无关模型可媲美甚至优于使用单语数据训练的模型,且它们在句子分类上通常更为有效。我们使用多种不同语言对语言无关模型进行实验,表明它们更适用于类型学上相似的语言。我们还探究了训练与测试语言无关模型时不同数据规模的影响,并证明它们不仅适用于高资源语言,在低资源语言中也非常有效。
引用
@article{arxiv.1912.13106,
title = {An Empirical Study of Factors Affecting Language-Independent Models},
author = {Xiaotong Liu and Yingbei Tong and Anbang Xu and Rama Akkiraju},
journal= {arXiv preprint arXiv:1912.13106},
year = {2020}
}