中文

学习语义文本相似度以对金融术语的上位词进行排序

计算与语言 2023-08-15 v2

摘要

多年来,用户访问金融服务的方式发生了范式转变。随着数字化的发展,更多用户倾向于以在线模式进行金融活动。这导致了海量金融内容的产生。多数投资者在决策前偏好浏览这些内容。每个行业都有其特定于所处领域的术语。银行与金融服务亦不例外。为充分理解这些内容,需对金融术语有透彻把握。当一个术语借助其所属宽泛类别加以解释时,获取其基本概念便变得容易。此宽泛类别被称为上位词(hypernym)。例如,“bond”是金融术语“alternative debenture”的上位词。在本文中,我们提出一个能为给定金融术语抽取并排序上位词的系统。该系统使用从 DBpedia [4]、Investopedia、金融产业业务本体(FIBO)、招股说明书等多种来源获取的金融文本语料库进行训练。这些术语的嵌入已使用 FinBERT [3]、FinISH [1] 抽取并经 SentenceBERT [54] 微调。我们采用一种新颖方法,利用 FIBO 中存在的层级结构以负样本扩充训练集。最后,我们将系统性能与现有系统基准比较。我们证实其表现优于现有系统且具可扩展性。

关键词

引用

@article{arxiv.2303.13475,
  title  = {Learning Semantic Text Similarity to rank Hypernyms of Financial Terms},
  author = {Sohom Ghosh and Ankush Chopra and Sudip Kumar Naskar},
  journal= {arXiv preprint arXiv:2303.13475},
  year   = {2023}
}

备注

Our code base: https://github.com/sohomghosh/FinSim_Financial_Hypernym_detection