UniversalNER:面向开放命名实体识别从大语言模型进行定向蒸馏
计算与语言
2024-01-22 v2
摘要
大语言模型(LLMs)已展现出显著的泛化能力,例如理解任意实体与关系。指令微调已被证明能有效地将 LLMs 蒸馏为更具成本效益的模型,如 Alpaca 和 Vicuna。然而,此类学生模型在下游应用中仍大幅落后于原始 LLMs。本文探索采用以任务为导向的指令微调进行定向蒸馏,以训练能在广阔应用类别(如开放信息抽取)中表现出色的学生模型。以命名实体识别(NER)为案例研究,我们展示了如何将 ChatGPT 蒸馏为小得多的 UniversalNER 模型用于开放 NER。为进行评估,我们构建了迄今最大的 NER 基准,包含来自生物医学、编程、社交媒体、法律、金融等 9 个不同领域的 43 个数据集。在不使用任何直接监督的情况下,UniversalNER 在上万种实体类型上取得了卓越的 NER 准确率,平均绝对 F1 值超过 Alpaca 和 Vicuna 等通用指令微调模型 30 余点。凭借极少的参数,UniversalNER 不仅获得了 ChatGPT 识别任意实体类型的能力,且平均 NER 准确率还高出其 7–9 个绝对 F1 点。值得注意的是,UniversalNER 甚至大幅优于使用有监督 NER 样本的最先进多任务指令微调系统(如 InstructUIE)。我们还进行了充分的消融实验以评估蒸馏方法中各组件的影响。我们发布了蒸馏方案、数据与 UniversalNER 模型,以促进未来关于定向蒸馏的研究。
引用
@article{arxiv.2308.03279,
title = {UniversalNER: Targeted Distillation from Large Language Models for Open Named Entity Recognition},
author = {Wenxuan Zhou and Sheng Zhang and Yu Gu and Muhao Chen and Hoifung Poon},
journal= {arXiv preprint arXiv:2308.03279},
year = {2024}
}
备注
Accepted at ICLR 2024. Project page: https://universal-ner.github.io/