中文

FETILDA:一种用于长金融文本文档微调嵌入的有效框架

计算与语言 2024-04-18 v1 人工智能 机器学习

摘要

非结构化数据,尤其是文本,在各领域中持续快速增长。特别是在金融领域,存在大量积累的非结构化金融数据,例如公司定期提交给监管机构(如证券交易委员会(SEC))的文本披露文档。这些文档通常非常长,且往往包含有关公司表现的宝贵软信息。因此,从这类长文本文档中学习预测模型,尤其是用于预测数值关键绩效指标(KPI),具有极大意义。尽管在从海量文本语料库学习的预训练语言模型(LM)方面已取得巨大进展,它们在长文档的有效表示上仍面临困难。我们的工作填补了这一关键需求,即如何开发更好的模型从长文本文档中提取有用信息,并学习能有效利用软金融与风险信息进行文本回归(预测)任务的特征。在本文中,我们提出并实现了一种深度学习框架,将长文档分块并利用预训练 LM 处理各块并聚合成向量表示,随后通过自注意力提取有价值的文档级特征。我们在来自美国银行的 10-K 公开披露报告集合以及另一个由美国公司提交的报告数据集上评估了我们的模型。总体而言,我们的框架优于强文本建模基线方法以及仅使用数值数据的基线回归模型。我们的工作更好地揭示了如何利用预训练领域特定且微调的长输入 LM 来表示长文档,可提升文本数据表示的质量,从而有助于改进预测分析。

关键词

引用

@article{arxiv.2206.06952,
  title  = {FETILDA: An Effective Framework For Fin-tuned Embeddings For Long Financial Text Documents},
  author = {Bolun "Namir" Xia and Vipula D. Rawte and Mohammed J. Zaki and Aparna Gupta},
  journal= {arXiv preprint arXiv:2206.06952},
  year   = {2024}
}

备注

10 pages, 9 figures, 7 tables