将少样本微调制定为面向语言模型预训练的任务:以命名实体识别为试点研究
计算与语言
2022-11-01 v2 人工智能
摘要
微调预训练语言模型近来已成为构建各类任务(尤其是少样本任务)NLP 模型的常见做法。我们认为,在少样本设定下,使微调更贴近预训练目标应能够释放预训练语言模型的更多益处。本工作中,我们以少样本命名实体识别(NER)为试点研究,其中现有微调策略与预训练差异甚大。我们提出一种新颖的 NER 少样本微调框架 FFF-NER。具体而言,我们引入三类新标记——“is-entity”、“which-type”与括号,从而可将 NER 微调制定为(掩码)标记预测或生成,取决于预训练语言模型的选择。实验中,我们将 FFF-NER 应用于在多个基准数据集上微调 BERT 与 BART 进行少样本 NER,并观察到相较现有微调策略(包括序列标注、原型元学习与基于提示的方法)的显著提升。我们进一步开展一系列消融研究,表明少样本 NER 性能与微调及预训练间相似度强相关。
引用
@article{arxiv.2205.11799,
title = {Formulating Few-shot Fine-tuning Towards Language Model Pre-training: A Pilot Study on Named Entity Recognition},
author = {Zihan Wang and Kewen Zhao and Zilong Wang and Jingbo Shang},
journal= {arXiv preprint arXiv:2205.11799},
year = {2022}
}