“多样性与不确定性在筛选中的结合”是多语言少样本迁移数据选择的关键
计算与语言
2022-07-01 v1
摘要
少样本迁移常比零样本迁移显示出显著增益~\cite{lauscher2020zero},这对于基于多语言预训练模型的系统而言,是介于全监督与无监督学习方法之间的一种实用权衡。本文探索了多种用于标注数据选择的策略,这些策略可带来更好的少样本迁移。所提方法依赖于多种度量,如基于 -gram 语言模型的数据熵、预测熵和梯度嵌入。我们提出一种用于序列标注任务的损失嵌入方法,其引出的多样性与不确定性采样类似于梯度嵌入。所提数据选择策略在多达 20 种语言的 POS 标注、NER 和 NLI 任务上进行了评估与比较。我们的实验表明,基于梯度和损失嵌入的策略持续优于随机数据选择基线,其增益随零样本迁移初始性能而变化。此外,即便在使用较低比例原始任务特定标注训练数据进行零样本迁移微调时,所提方法也显示出类似的改进趋势。
引用
@article{arxiv.2206.15010,
title = {"Diversity and Uncertainty in Moderation" are the Key to Data Selection for Multilingual Few-shot Transfer},
author = {Shanu Kumar and Sandipan Dandapat and Monojit Choudhury},
journal= {arXiv preprint arXiv:2206.15010},
year = {2022}
}
备注
NAACL 2022