基于深度循环网络的公司名称消歧
计算与语言
2023-11-22 v2 人工智能
数据库
机器学习
摘要
命名实体消歧是自然语言处理中识别对应于同一命名实体的文本记录的任务,即表示为属性列表(名称、地点、组织等)的真实世界实体。在本工作中,我们面对基于公司书面名称对公司进行消歧的任务。我们提出了一种孪生LSTM网络方法,通过监督学习将公司名称字符串嵌入(相对)低维向量空间,并利用该表示来识别实际代表同一公司(即同一实体)的公司名称对。鉴于字符串对的手动标注是相当繁重的任务,我们分析了以主动学习方法来优先安排待标注样本如何带来更高效的整体学习流程。通过实证调研,我们表明所提出的孪生网络在有足够标注数据可用时优于若干基于标准字符串匹配算法的基准方法。此外,我们表明在标注资源有限时主动学习优先排序确实有帮助,并使学习模型相较于标准(随机)数据标注方法以更少的标注数据达到样本外性能饱和。
引用
@article{arxiv.2303.05391,
title = {Disambiguation of Company names via Deep Recurrent Networks},
author = {Alessandro Basile and Riccardo Crupi and Michele Grasso and Alessandro Mercanti and Daniele Regoli and Simone Scarsi and Shuyi Yang and Andrea Cosentini},
journal= {arXiv preprint arXiv:2303.05391},
year = {2023}
}
备注
submitted to Elsevier. 26 pages, 6 figures, 4 tables