中文

利用多粒度文本分析追踪金融文档中的内容要求

信息检索 2025-03-26 v2

摘要

金融文档的内容完整性是投资基金的一项基本要求。为确保完整性,金融监管机构必须耗费大量时间,依据相关内容要求仔细核查每份金融文档,这些内容要求规定了金融文档中应包含的信息类型(例如股份发行条件与程序的描述)。然而,由于金融文档的复杂性,现有技术对帮助监管者自动识别与金融信息类型相关的文本块支持有限。在本文中,我们提出FITI,通过多粒度文本分析来追踪金融文档中的内容要求。给定一份新金融文档,FITI首先筛选一组候选句子以高效识别信息类型。然后,为对候选句子排序,FITI结合基于规则与以数据为中心的方法,利用信息检索(IR)和机器学习(ML)技术分析涉及某信息类型的词、句子与上下文。最后,一个基于启发式的选择器综合考虑句子排序与领域特定短语,确定出对应于各信息类型的句子列表。我们通过评估FITI在100份真实世界金融文档中追踪金融内容要求的有效性来评价它。实验结果表明,FITI能够提供精确识别,平均精确率、召回率和F1值分别为0.824、0.646和0.716。FITI的总体准确率在F1值上显著优于最佳基线(基于Transformer语言模型)0.266。此外,FITI可帮助监管者检测出金融文档中约80%的缺失信息类型。

关键词

引用

@article{arxiv.2110.14960,
  title  = {Tracing Content Requirements in Financial Documents using Multi-granularity Text Analysis},
  author = {Xiaochen Li and Domenico Bianculli and Lionel C. Briand},
  journal= {arXiv preprint arXiv:2110.14960},
  year   = {2025}
}

备注

27 pages, 5 figures