MiMIC:面向预测股票价格的多模态印度财报数据集
机器学习
2025-04-15 v1 人工智能
计算与语言
摘要
预测公司财报发布后的股价价格是投资者和研究人员面临的重要挑战,要求具备处理多元信息源的创新方法。本研究通过引入一种多模态预测模型,探讨公司财报对股价的影响。我们利用来自财报记录的文本数据,以及来自随附演示文稿中的图片和表格,用于预测财报发布后交易日的股价走势。为促进此项研究,我们开发了MiMIC(Multi-Modal Indian Earnings Calls)数据集,涵盖代表Nifty 50、Nifty MidCap 50和Nifty Small 50指数的公司。该数据集包括财报记录、演示文稿、基本面数据、技术指标以及后续股价。我们提出了一种多模态分析框架,将定量变量与从文本和视觉模态派生的预测信号相集成,从而实现对特征表示和分析的整体方法。这种多模态方法证明了将多元信息源集成以提高金融预测准确性的潜力。为促进计算经济学领域的进一步研究,我们已在CC-NC-SA-4.0许可证下公开提供MiMIC数据集。我们的工作 CONTRIBUTES to the growing body of literature on market reactions to corporate communications and highlights the efficacy of multi-modal machine learning techniques in financial analysis.
引用
@article{arxiv.2504.09257,
title = {MiMIC: Multi-Modal Indian Earnings Calls Dataset to Predict Stock Prices},
author = {Sohom Ghosh and Arnab Maji and Sudip Kumar Naskar},
journal= {arXiv preprint arXiv:2504.09257},
year = {2025}
}
备注
Code and Dataset: https://huggingface.co/datasets/sohomghosh/MiMIC_Multi-Modal_Indian_Earnings_Calls_Dataset