中文

从大型语言模型中蒸馏濒危物种命名实体识别模型

计算与语言 2024-03-26 v1

摘要

自然语言处理(NLP)从业者正利用大型语言模型(LLM)从专利、论文和学位论文等半结构化和非结构化数据源中创建结构化数据集,而无需具备领域特定知识。与此同时,生态学专家正在寻找多种手段来保护生物多样性。为了对这些努力做出贡献,我们聚焦于濒危物种,并通过上下文学习从GPT-4中蒸馏知识。实际上,我们通过一个两阶段过程创建了用于命名实体识别(NER)和关系抽取(RE)的数据集:1)我们利用GPT-4生成了四类濒危物种的合成数据;2)人工验证了合成数据的事实准确性,从而得到了黄金数据。最终,我们的新数据集总共包含3.6K个句子,平均分为1.8K个NER句子和1.8K个RE句子。构建的数据集随后被用于微调通用BERT和领域特定的BERT变体,完成了从GPT-4到BERT的知识蒸馏过程,因为GPT-4是资源密集型的。实验表明,我们的知识迁移方法能有效创建一个适用于从文本中检测濒危物种的NER模型。

关键词

引用

@article{arxiv.2403.15430,
  title  = {Distilling Named Entity Recognition Models for Endangered Species from Large Language Models},
  author = {Jesse Atuhurra and Seiveright Cargill Dujohn and Hidetaka Kamigaito and Hiroyuki Shindo and Taro Watanabe},
  journal= {arXiv preprint arXiv:2403.15430},
  year   = {2024}
}