数据集嵌入在单语、多语与零样本条件下的有效性研究
计算与语言
2021-03-08 v2
摘要
近期互补的研究方向表明,通过将数据源的属性编码为嵌入来利用数据源信息,在异构数据源上训练单一模型时可带来性能提升。然而,由于数据集嵌入被应用于大量不同的设置、语言和任务中,其在何种情形下最为有效仍不明确。此外,通常假定可获得关于数据源的黄金标注信息,且测试数据来自训练期间所见过的分布。在本工作中,我们比较了数据集嵌入在单语设置、多语设置以及零样本设置中使用预测数据源标签时的效果。我们在三个形态句法任务上进行了评估:形态标注、词形还原和依存句法分析,使用了104个数据集、66种语言以及两种不同的数据集分组策略。当数据集为同一语言且我们已知测试实例来自何种分布时,性能提升最高。相反,对于数据来自未见分布的设置,性能提升消失。
引用
@article{arxiv.2103.01273,
title = {On the Effectiveness of Dataset Embeddings in Mono-lingual,Multi-lingual and Zero-shot Conditions},
author = {Rob van der Goot and Ahmet Üstün and Barbara Plank},
journal= {arXiv preprint arXiv:2103.01273},
year = {2021}
}