中文

信息抽取:在发展中国家超本地化金融数据领域的应用

计算与语言 2024-03-15 v1

摘要

尽管发展研究和经济分析需要发展中国家公司活动的金融数据,但此类数据并不存在。在本项目中,我们开发并评估了两种基于自然语言处理(NLP)的技术来解决这个问题。首先,我们整理了一个特定于发展中国家金融文本数据领域的自定义数据集,并探索了多种信息抽取方法。然后,我们探索了使用基于 Transformer 的 T5 模型的文本到文本方法,目标是同时进行 NER 和关系抽取。我们发现,该模型能够学习对应于实体及其关系的自定义文本结构输出数据,在我们的最佳 T5 模型上,该联合任务取得了 92.44% 的准确率、68.25% 的精确率和 54.20% 的召回率。其次,我们探索了一种顺序进行 NER 和关系抽取的方法。对于 NER,我们使用 SpaCy 运行预训练和微调的模型,并且我们利用 SpaCy 的 Dependency Parser 输出和一些启发式方法开发了一个自定义关系抽取模型来确定实体关系 \cite{spacy}。在该顺序任务上,我们获得了 84.72% 的准确率、6.06% 的精确率和 5.57% 的召回率。

关键词

引用

@article{arxiv.2403.09077,
  title  = {Information Extraction: An application to the domain of hyper-local financial data on developing countries},
  author = {Abuzar Royesh and Olamide Oladeji},
  journal= {arXiv preprint arXiv:2403.09077},
  year   = {2024}
}