类型学盲化会阻碍跨语言共享吗?
计算与语言
2021-01-29 v1 人工智能
摘要
缩小高资源语言与低资源语言之间的性能差距一直是许多先前工作的焦点。来自诸如世界语言结构图谱(WALS)等数据库的类型学特征是一个主要候选,因为即便对极低资源语言也存在此类数据。然而,先前工作仅发现使用类型学信息的微小收益。我们的假设是,在跨语言设置中训练的模型会从输入数据中捕捉类型学线索,从而掩盖显式使用此类特征的效用。我们通过将模型盲化于类型学信息来验证该假设,并研究跨语言共享与性能如何受影响。我们的模型基于一种跨语言架构,其中控制语言间共享的潜在权重在训练期间被学习。我们表明(i)阻止该模型利用类型学严重降低性能,而一个对照实验重申(ii)依据类型学鼓励共享在一定程度上提升性能。
引用
@article{arxiv.2101.11888,
title = {Does Typological Blinding Impede Cross-Lingual Sharing?},
author = {Johannes Bjerva and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2101.11888},
year = {2021}
}
备注
EACL 2021