面向序列标注的上下文嵌入无监督域自适应
计算与语言
2019-09-06 v2 数字图书馆
机器学习
摘要
ELMo 和 BERT 等上下文词嵌入通过对大规模无标注文本语料进行预训练,为广泛的自然语言处理任务提供了强劲性能的基础。然而,当目标域与预训练语料差异显著时,该方法的有效性尚属未知。我们特别关注这样一种场景:仅在如新闻文本这类规范源域中有标注数据可用,而目标域既不同于标注文本也不同于预训练文本。针对该场景,我们提出了域自适应微调(domain-adaptive fine-tuning),即通过目标域文本上的掩码语言建模(masked language modeling)对上下文嵌入进行自适应。我们在两个具有挑战性的域——早期现代英语和 Twitter——上测试了该方法在序列标注中的表现。这两个域均与现有预训练语料差异显著,而域自适应微调相较强大的 BERT 基线带来了实质性提升,尤其对集外词(out-of-vocabulary words)效果惊人。我们得出结论:域自适应微调为序列标注向困难新域的无监督自适应提供了一种简单而有效的途径。
引用
@article{arxiv.1904.02817,
title = {Unsupervised Domain Adaptation of Contextualized Embeddings for Sequence Labeling},
author = {Xiaochuang Han and Jacob Eisenstein},
journal= {arXiv preprint arXiv:1904.02817},
year = {2019}
}
备注
EMNLP 2019