从维基到汽车:理解分布偏移及其对命名实体识别的影响
计算与语言
2021-12-02 v1
摘要
尽管迁移学习已成为自然语言处理(NLP)任务中普遍使用的技术,它往往无法在汽车等小众领域文本上复现预训练模型的性能。本文旨在理解汽车领域文本(描述如巡航控制等技术功能)分布偏移的主要特征,并尝试解释性能差距的潜在原因。我们聚焦于执行命名实体识别(NER)任务,因为该任务需要模型具备较强的词法、句法与语义理解能力。我们使用两种不同的编码器(即BERT-Base-Uncased和SciBERT-Base-Scivocab-Uncased)进行的实验得出了有趣发现:1)用于汽车领域时SciBERT的性能优于BERT;2)用汽车领域文本微调语言模型并未显著改善NER性能;3)分布偏移具有挑战性,其表现为缺乏重复上下文、实体稀疏、大量集外词(OOV)以及因领域特定细微差别导致的类别重叠。
引用
@article{arxiv.2112.00283,
title = {Wiki to Automotive: Understanding the Distribution Shift and its impact on Named Entity Recognition},
author = {Anmol Nayak and Hari Prasad Timmapathini},
journal= {arXiv preprint arXiv:2112.00283},
year = {2021}
}
备注
6 pages, 1 figure