FinBERT-MRC:基于机器阅读理解范式的 BERT 金融命名实体识别
计算与语言
2022-06-01 v1
摘要
从文献中进行金融命名实体识别(FinNER)是金融文本信息抽取领域的一项具有挑战性的任务,旨在从非结构化文本中抽取大量金融知识。人们广泛接受使用序列标注框架来实现 FinNER 任务。然而,此类序列标注模型无法充分利用文本中的语义信息。相反,我们将 FinNER 任务表述为机器阅读理解(MRC)问题,并提出了一种称为 FinBERT-MRC 的新模型。该表述通过利用精心设计的查询引入了显著的先验信息,并在无诸如条件随机场(CRF)等解码模块的情况下提取目标实体的起始索引和结束索引。我们在公开可用的中文金融数据集 ChFinAnn 和真实业务数据集 AdminPunish 上进行了实验。FinBERT-MRC 模型在两个数据集上分别取得了 92.78% 和 96.80% 的平均 F1 分数,较包括 BiLSTM-CRF、BERT-Tagger 和 BERT-CRF 在内的一些序列标注模型平均 F1 提升分别为 +3.94% 和 +0.89%。源代码可在 https://github.com/zyz0000/FinBERT-MRC 获取。
引用
@article{arxiv.2205.15485,
title = {FinBERT-MRC: financial named entity recognition using BERT under the machine reading comprehension paradigm},
author = {Yuzhe Zhang and Hong Zhang},
journal= {arXiv preprint arXiv:2205.15485},
year = {2022}
}