中文

为低成本少样本学习预先剔除相异源域

计算与语言 2021-09-14 v1 人工智能

摘要

少样本槽位标注是自然语言理解(NLU)领域一个新兴的研究课题。在拥有来自源域的充分标注数据的情况下,关键挑战是如何训练模型并将其适配到另一个仅含少量标签的目标域。传统的少样本方法使用来自源域的所有数据,不考虑域间关系,并隐式假设域中每个样本贡献相等。然而,我们的实验表明,不同域之间的数据分布偏差会显著影响适配性能。此外,从相异域迁移知识甚至会引入一些额外噪声,从而影响模型性能。为解决此问题,我们提出一种有效的基于相似度的方法从源域选择数据。此外,我们针对少样本槽位标注任务提出共享-私有网络(SP-Net)。来自同一类的词会具有一些共享特征。我们从目标域有限的标注数据中提取这些共享特征,并将其合并作为标签嵌入,以帮助预测目标域上其他未标注数据。实验表明,我们的方法以更少的源数据优于最先进的方法。结果也证明,来自相异源的一些训练数据是冗余的,甚至对适配有负面作用。

关键词

引用

@article{arxiv.2109.05234,
  title  = {Prior Omission of Dissimilar Source Domain(s) for Cost-Effective Few-Shot Learning},
  author = {Zezhong Wang and Hongru Wang and Kwan Wai Chung and Jia Zhu and Gabriel Pui Cheong Fung and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2109.05234},
  year   = {2021}
}