中文

FiNER:面向 XBRL 标注的金融数值实体识别

计算与语言 2023-05-31 v2

摘要

上市公司须提交带有可扩展商业报告语言(XBRL)词级标签的定期报告。人工标注报告繁琐且成本高昂。因此,我们将 XBRL 标注作为金融领域一项新的实体抽取任务提出,并发布 FiNER-139,一个含 1.1M 句带黄金 XBRL 标签的数据集。与典型实体抽取数据集不同,FiNER-139 使用大得多的 139 类实体标签集。多数标注词元为数值,每个词元的正确标签主要取决于上下文而非词元本身。我们表明数值表达式的子词分割损害了 BERT 的性能,使得词级 BILSTM 表现更优。为提升 BERT 性能,我们提出两种简单有效的方案,将数值表达式替换为反映原始词元形状与数值大小的伪词元。我们还用现有金融领域 BERT 模型 FIN-BERT 实验,并发布自有的 BERT(SEC-BERT,在金融申报文件上预训练),其表现最佳。通过数据与误差分析,我们最终识别出可能的局限,以启发未来 XBRL 标注工作。

关键词

引用

@article{arxiv.2203.06482,
  title  = {FiNER: Financial Numeric Entity Recognition for XBRL Tagging},
  author = {Lefteris Loukas and Manos Fergadiotis and Ilias Chalkidis and Eirini Spyropoulou and Prodromos Malakasiotis and Ion Androutsopoulos and Georgios Paliouras},
  journal= {arXiv preprint arXiv:2203.06482},
  year   = {2023}
}

备注

13 pages, long paper at ACL 2022