基于语义的金融文本时序数据集 FinTexTS
人工智能
2026-05-28 v3 机器学习
摘要
金融领域涉及多种重要时序问题。最近,能够联合利用文本和数值信息的时序分析方法受到日益关注。为此,已对金融领域的文本-时序数据集构建作出诸多努力。然而,金融市场以复杂的相互关联为特征,其中公司股票价格不仅受公司自身事件影响,也受其他公司及更广泛宏观经济因素事件影响。基于简单关键词匹配构建文本-金融时序数据对的现有方法往往难以捕获此类复杂关系。为解决此限制,我们提出一种基于语义的多层次配对框架。具体而言,我们从 SEC 公告文件中提取针对目标公司的公司特定上下文,并应用基于嵌入的匹配机制检索与之语义相关的新闻文章。此外,我们利用大型语言模型 (LLM) 将新闻文章分类为四个层次(宏观层次、行业层次、相关公司层次和目标公司层次),实现对新闻文章与目标公司的多层次配对。将此框架应用于公开新闻数据集,我们构建了 FinTexTS,一个大型文本-时序股票价格数据集。在 FinTexTS 上进行的实验结果表明,我们基于语义的多层次配对策略在股票价格预测中有效。除了公开的新闻数据集外,我们还展示将此方法应用于专门筛选的专有新闻来源可获得更高质量的配对数据并提升股票价格预测性能。
引用
@article{arxiv.2603.02702,
title = {FinTexTS: Financial Text-Paired Time-Series Dataset via Semantic-Based and Multi-Level Pairing},
author = {Jaehoon Lee and Suhwan Park and Taeyoon Lim and Seunghan Lee and Jun Seo and Dongwan Kang and Hwanil Choi and Minjae Kim and Sungdong Yoo and Soonyoung Lee and Yongjae Lee and Wonbin Ahn},
journal= {arXiv preprint arXiv:2603.02702},
year = {2026}
}
备注
12 pages, KDD 2026, Datasets and Benchmarks Track