“Squawk Bot”:时间序列与文本数据模态联合学习用于自动化金融信息过滤
计算与语言
2019-12-24 v1 机器学习
统计金融
机器学习
摘要
使用数值时间序列和文本语料作为输入数据源的多模态分析正成为一种有前景的方法,尤其在金融业。然而,此类分析的主要焦点在于实现高预测精度,而很少着力于理解两种数据模态之间关联这一重要任务。尽管人类可理解的文本信息可用,时间序列上的表现却很少得到解释。本工作中,我们解决的问题是:给定数值时间序列,以及在同一时间段收集的一般文本故事语料,任务是及时发掘与该时间序列关联的简洁文本故事集合。为此,我们提出一种称为 MSIN 的新型多模态神经模型,它联合学习数值时间序列与类别化文本文章以发掘二者间关联。通过两模态间的多步数据互关联,MSIN 学会聚焦于与时间序列表现最契合的一小子集文本文章。该简洁集合被及时发掘并作为推荐文档呈现,充当针对给定时间序列的自动化信息过滤。我们在从苹果和谷歌公司两条股票时间序列发现相关新闻文章的任务上实证评估了模型性能,数据伴随从 Thomson Reuters 连续七年收集的日常新闻文章。实验结果表明,MSIN 在召回真实文章上分别对两条 examined 时间序列达到 84.9% 和 87.2%,远优于依赖深度学习常规注意力机制的 SOTA 算法。
引用
@article{arxiv.1912.10858,
title = {"The Squawk Bot": Joint Learning of Time Series and Text Data Modalities for Automated Financial Information Filtering},
author = {Xuan-Hong Dang and Syed Yousaf Shah and Petros Zerfos},
journal= {arXiv preprint arXiv:1912.10858},
year = {2019}
}