IITK 在 FinSim 任务中的方法:基于上下文无关与上下文相关词嵌入的金融领域上位词检测
计算与语言
2020-07-23 v1 机器学习
计算金融
摘要
在本文中,我们介绍了针对 FinSim 2020 共享任务“学习金融领域的语义表示”所提出的方法。该任务的目标是将金融术语分类到外部本体中最相关的上位词(或顶层)概念。我们在分析中同时利用了上下文相关与上下文无关的词嵌入。我们的系统部署了从语料库(英文金融招股说明书)从头训练的 Word2vec 嵌入,以及预训练的 BERT 嵌入。我们基于一条领域规则将测试数据集划分为两个子集。对于其中一个子集,我们使用无监督距离度量对术语进行分类;对于第二个子集,我们在嵌入之上使用如朴素贝叶斯等简单的有监督分类器来得到最终预测。最后,我们合并两个结果。我们的系统在两项指标(即平均排名与准确率)上均排名第 1。
引用
@article{arxiv.2007.11201,
title = {IITK at the FinSim Task: Hypernym Detection in Financial Domain via Context-Free and Contextualized Word Embeddings},
author = {Vishal Keswani and Sakshi Singh and Ashutosh Modi},
journal= {arXiv preprint arXiv:2007.11201},
year = {2020}
}
备注
6 pages, 1 figure, 4 tables. Accepted at the Second Workshop on Financial Technology and Natural Language Processing (FinNLP-2020)