面向法语命名实体识别的对抗自适应
计算与语言
2023-01-13 v1 人工智能
机器学习
摘要
命名实体识别(NER)的任务是在大规模文本中识别命名实体并将其分类到预定义的类别中。由于缺乏庞大且鲁棒的数据集,法语及其他相对有限资源的语言的 NER 并不总能从为英语等语言提出的方法中获益。在本文中,我们介绍了旨在减轻这种大型标注数据集匮乏影响的工作。我们提出了一种基于 Transformer 的法语 NER 方法,通过对相似领域或通用语料库的对抗自适应来改善特征提取并实现更好的泛化。我们的方法允许利用来自同领域或混合领域的大规模无标注语料库来学习更好的特征,以在训练期间引入更多变化并减少过拟合。在三个标注数据集上的实验结果表明,对于各种 Transformer 模型、源数据集和目标语料库的组合,我们的自适应框架均优于相应的非自适应模型。我们还表明,对大规模无标注语料库的对抗自适应有助于缓解在使用基于较小语料库预训练的 Transformer 模型时出现的性能下降。
关键词
引用
@article{arxiv.2301.05220,
title = {Adversarial Adaptation for French Named Entity Recognition},
author = {Arjun Choudhry and Inder Khatri and Pankaj Gupta and Aaryan Gupta and Maxime Nicol and Marie-Jean Meurs and Dinesh Kumar Vishwakarma},
journal= {arXiv preprint arXiv:2301.05220},
year = {2023}
}
备注
Preprint version of short paper accepted for the ECIR 2023 conference