中文

基于LLM的财务报告三元组抽取

计算与语言 2026-02-13 v1

摘要

公司财务报告是知识图谱构建中结构化知识的宝贵来源,但该领域缺乏标注的真实数据使得评估变得困难。我们提出了一种半自动化的主谓宾三元组抽取流水线,该流水线使用本体驱动的代理指标(具体为本体符合度和忠实度)替代基于真实数据的评估。我们比较了静态的手工工程化本体与完全自动化的、文档特定的本体归纳方法,涉及不同的LLM和两份公司年度报告。自动归纳的本体在所有配置下均实现了100%的模式符合度,消除了手动方法中观察到的本体漂移。我们还提出了一种混合验证策略,该策略结合了正则表达式匹配和LLM作为评判者的检查,通过过滤由共指消解引起的误报,将明显的主语幻觉率从65.2%降低到1.6%。最后,我们识别了主语和宾语幻觉之间的系统性不对称性,我们将其归因于财务散文中被动结构和省略的施动者。

关键词

引用

@article{arxiv.2602.11886,
  title  = {LLM-based Triplet Extraction from Financial Reports},
  author = {Dante Wesslund and Ville Stenström and Pontus Linde and Alexander Holmberg},
  journal= {arXiv preprint arXiv:2602.11886},
  year   = {2026}
}