FinTextSim:用于增强金融文本分析的 BERTopic 研究
计算与语言
2025-04-23 v1 机器学习
综合经济学
经济学
综合金融
摘要
近期信息获取能力和计算能力的进步已转变了年度报告的分析方式,将传统财务指标与文本数据的洞察力率ologically 集成。为了从这大量文本数据中提取有价值的见解,自动化审阅过程(如主题建模)至关重要。本研究考察了 BERTopic——一种基于语境嵌入的领先主题模型——用于分析由 S&P 500 公司提交的 2016-2022 年的第 7 项和第 7A 项 10-K 文件。此外,我们引入了 FinTextSim,这是一个针对金融语境下的聚类和语义搜索进行微调的句子嵌入模型。相较于最广泛使用的句子嵌入模型 all-MiniLM-L6-v2,FinTextSim 将主题内相似性提高 81%,将主题间相似性降低 100%,显著提升了组织清晰度。我们使用来自 FinTextSim 和 all-MiniLM-L6-v2 的嵌入评估了 BERTopic 的性能。我们的发现表明,只有搭配 FinTextSim 的嵌入,BERTopic 才能形成清晰且具有区分性的经济主题聚类。没有 FinTextSim 时,BERTopic 难以处理误分类和重叠主题。因此,FinTextSim 是推动金融文本分析发展的关键因素。FinTextSim 的增强语境嵌入针对金融领域进行优化,提升了未来研究和金融信息质量的水平。这一金融信息质量的提升将使利益相关者获得竞争优势,简化资源配置和决策过程。此外,改进的洞察有望提升商业估值和股票价格预测模型的性能。
关键词
引用
@article{arxiv.2504.15683,
title = {FinTextSim: Enhancing Financial Text Analysis with BERTopic},
author = {Simon Jehnen and Joaquín Ordieres-Meré and Javier Villalba-Díez},
journal= {arXiv preprint arXiv:2504.15683},
year = {2025}
}