通过潜在狄利克雷分配主题建模自动检测金融新闻中的相关信息、预测和预报
计算与语言
2024-04-03 v1 计算工程、金融与科学
信息检索
机器学习
统计金融
摘要
金融新闻是非结构化的信息来源,可以挖掘以提取市场筛选应用的知识。从持续不断的金融相关新闻流中手动提取相关信息既繁琐又超出许多投资者的能力,他们最多只能关注少数几个来源和作者。因此,我们专注于分析金融新闻,以识别相关文本,以及该文本中的预测和预报。我们提出了一种新颖的自然语言处理(NLP)系统,通过考虑语篇层面的相关性和时间性,帮助投资者检测非结构化文本源中的相关金融事件。首先,我们对文本进行分割,将紧密相关的文本分组在一起。其次,我们应用共指消解来发现片段内的内部依赖关系。最后,我们使用潜在狄利克雷分配(LDA)进行相关主题建模,以区分相关文本和不太相关的文本,然后使用面向机器学习的时间方法分析相关文本,以识别预测和推测性陈述。我们创建了一个由2,158条金融新闻组成的实验数据集,由NLP研究人员手动标注以评估我们的解决方案。相关文本和预测/预报识别的ROUGE-L值分别为0.662和0.982。据我们所知,这是第一个在语篇层面同时考虑相关性和时间性的工作。它通过结合多段落主题分割和共指消解来分离作者表达模式、使用LDA进行主题建模以检测相关文本,以及语篇时间性分析以识别该文本中的预测和预报,有助于将人类联想话语能力转移到专家系统中。
引用
@article{arxiv.2404.01338,
title = {Automatic detection of relevant information, predictions and forecasts in financial news through topic modelling with Latent Dirichlet Allocation},
author = {Silvia García-Méndez and Francisco de Arriba-Pérez and Ana Barros-Vila and Francisco J. González-Castaño and Enrique Costa-Montenegro},
journal= {arXiv preprint arXiv:2404.01338},
year = {2024}
}