预训练编码器在低资源命名实体识别中的比较研究
计算与语言
2022-04-12 v1
摘要
预训练语言模型(PLM)在少量样本命名实体识别(NER)方法中是有效的组件,当通过在与任务相关的域外数据上继续预训练或在域内数据上微调进行增强时尤为如此。然而,在无法获取此类数据的低资源场景下,它们的性能仍是一个开放问题。我们引入了一个编码器评估框架,并用它系统地比较了最先进的预训练表示在低资源NER任务上的性能。我们分析了以不同策略、模型架构、中间任务微调和对比学习预训练的大量编码器。我们在英语和德语的十个基准NER数据集上的实验结果表明,编码器性能差异显著,这意味着针对特定低资源场景的编码器选择需要仔细评估。
引用
@article{arxiv.2204.04980,
title = {A Comparative Study of Pre-trained Encoders for Low-Resource Named Entity Recognition},
author = {Yuxuan Chen and Jonas Mikkelsen and Arne Binder and Christoph Alt and Leonhard Hennig},
journal= {arXiv preprint arXiv:2204.04980},
year = {2022}
}
备注
Accepted at Repl4NLP 2022 (ACL)