中文

基于向量化词法-句法模式最近邻搜索的金融文档关系抽取

计算与语言 2023-10-30 v1 计算工程、金融与科学

摘要

在预训练语言模型的帮助下,关系抽取(RE)取得了显著进展。然而,现有 RE 模型通常难以处理两种情形:由语言复杂性和数据稀疏性导致的隐式表达与长尾关系类别。此外,这些方法和模型对于无法直接访问大语言模型(LLMs)和/或缺乏监督训练或微调基础设施的用户而言基本不可用。基于规则的系统同样难以应对隐式表达。除此之外,公开交易公司的各类 10-X 报告(包括 10-K、10-Q 等)等真实世界金融文档,因其更长且复杂的句子,对基于规则的系统构成了另一挑战。本文中,我们引入一种简单方法,在测试时通过对词法-句法模式的稠密向量进行最近邻搜索来参考训练关系,为应对上述问题提供了简单而有效的手段。我们在 REFinD 上评估了该方法,结果表明我们的方法达到了最先进的性能。我们进一步表明,在仅有少量标注可用时,它可为人在回路设置提供良好起点,且当领域专家能提供高质量模式时同样有益。

关键词

引用

@article{arxiv.2310.17714,
  title  = {Nearest Neighbor Search over Vectorized Lexico-Syntactic Patterns for Relation Extraction from Financial Documents},
  author = {Pawan Kumar Rajpoot and Ankur Parikh},
  journal= {arXiv preprint arXiv:2310.17714},
  year   = {2023}
}