CO-Fun:一个用于命名实体识别与关系抽取的德国基金招募说明书公司外包数据集
计算与语言
2024-03-25 v1
摘要
网络映射过程揭示了金融实体与服务提供商之间的关系。围绕德国基金招募说明书中公司的外包实践,我们引入了一个专门为命名实体识别和关系抽取任务设计的数据集。三位专家对 948 个句子进行了标注,产生了针对四种实体类型(外包、公司、地点和软件)的 5,969 个标注和 4,102 个关系标注(外包-公司、公司-地点)。我们训练了最先进的深度学习模型来识别实体和抽取关系,初步结果令人鼓舞。该数据集的匿名版本,连同标注指南和用于模型训练的代码,已在 https://www.dfki.uni-kl.de/cybermapping/data/CO-Fun-1.0-anonymized.zip 公开提供。
引用
@article{arxiv.2403.15322,
title = {CO-Fun: A German Dataset on Company Outsourcing in Fund Prospectuses for Named Entity Recognition and Relation Extraction},
author = {Neda Foroutan and Markus Schröder and Andreas Dengel},
journal= {arXiv preprint arXiv:2403.15322},
year = {2024}
}