基于指令模型的细粒度合同命名实体识别
信息检索
2024-01-25 v1
摘要
近来,基于指令的技术在提升少样本学习场景性能方面取得了显著进展。它们通过弥合预训练语言模型与针对特定下游任务微调之间的差距来实现这一点。尽管有这些进步,大型语言模型(LLM)在使用提示或指令进行命名实体识别(NER)等信息抽取任务时,其性能仍不及监督基线。这种性能差距可归因于 NER 与 LLM 之间的根本差异。NER 本质上是一个序列标注任务,模型必须为句子中的每个词元分配实体类型标签。相比之下,LLM 被设计为文本生成任务。这种语义标注与文本生成之间的区别导致了性能不佳。在本文中,我们将 NER 任务转化为一个可被 LLM 轻松适应的文本生成任务。这涉及用任务特定的指令和答案选项增强源句子,从而能够在自然语言中识别实体及其类型。我们通过在 LLM 内部集成监督学习来利用其优势。这种组合策略的目标是提升 LLM 在 NER 等抽取任务上的性能,同时解决 LLM 生成内容中常见的幻觉问题。我们发布了一个新颖的合同 NER 语料库,包含七种常见的合同类别,涵盖与 18 种不同法律实体类型相关的命名实体,并提供了基线模型。我们的模型和数据集已向社区开放,供未来研究使用。
引用
@article{arxiv.2401.13545,
title = {Fine-grained Contract NER using instruction based model},
author = {Hiranmai Sri Adibhatla and Pavan Baswani and Manish Shrivastava},
journal= {arXiv preprint arXiv:2401.13545},
year = {2024}
}