Context-NER:大规模上下文短语生成
信息检索
2023-06-12 v4 计算与语言
机器学习
摘要
命名实体识别(NER)近年来取得了显著进展,众多最先进(SOTA)模型实现了高性能。然而,极少有研究关注实体上下文的生成。在本文中,我们引入CONTEXT-NER,一项旨在为句子中的实体生成相关上下文的任务,其中上下文是描述该实体的短语,但不一定出现在句子中。为促进该任务的研究,我们还提出了EDGAR10-Q数据集,其由1500家顶级上市公司的年度和季度报告组成。该数据集是同类中规模最大的,包含100万句子、280万实体,平均每条句子35个词元,是一个具有挑战性的数据集。我们提出了一种基线方法,将短语生成算法与基于220M语言模型的推理相结合,在测试集上取得了27%的ROUGE-L分数。此外,我们使用ChatGPT进行单次推理,获得30%的ROUGE-L,凸显了该数据集的难度。我们还评估了T5和BART等模型,它们在EDGAR10-Q上监督微调后取得了最高49%的ROUGE-L。我们还发现,在EDGAR10-Q上预微调的T5-large,在Headline、FPB和FiQA SA等下游金融任务上取得了SOTA结果,比原始版本高出10.81分。令人惊讶的是,这个小66倍的预微调模型也超越了金融专用LLM BloombergGPT-50B达15分。我们希望我们的数据集和生成的产物能鼓励该方向的进一步研究,从而开发出更精细的金融文本分析语言模型。
引用
@article{arxiv.2109.08079,
title = {Context-NER : Contextual Phrase Generation at Scale},
author = {Himanshu Gupta and Shreyas Verma and Santosh Mashetty and Swaroop Mishra},
journal= {arXiv preprint arXiv:2109.08079},
year = {2023}
}
备注
29 pages, 5 Figures, 2 AlgorithmS, 17 Tables. Accepted in NeurIPS 2022 - Efficient Natural Language and Speech Processing (ENLSP) Workshop