中文

利用搜索引擎查询量预测标普 100 指数成分股的日间先行收益

计量经济学 2022-06-02 v2 机器学习

摘要

互联网改变了我们生活、工作与决策的方式。作为现代研究的主要资源,关于互联网使用的详尽数据展现出大量的行为信息。本文旨在回答此类信息是否可被用以预测金融资本市场中股票的未来收益这一问题。在实证分析中,其采用梯度提升决策树(gradient boosted decision trees)来学习 S&P 100 指数内股票的异常收益与源自历史金融数据以及谷歌(Google)互联网搜索引擎搜索词查询量的滞后预测变量之间的关系。模型预测指数中位数之上的日间先行股票收益的出现。在 2005 至 2017 年的时间区间内,所有异质数据集均展现出有价值的信息。经评估模型的受试者工作特征曲线下平均面积介于 54.2% 与 56.7% 之间,明确表明分类优于随机猜测。通过实施简单的统计套利策略,模型用于构建十只股票的每日交易组合,并在扣除交易成本前取得逾 57% 的年度表现。随着不同数据集的集成登顶性能排名,结果进一步质疑现代金融资本市场的弱式有效与半强式有效。尽管未计入交易成本,该方法仍对现有文献有所增补。其为如何运用并转化互联网使用行为数据于金融与经济建模及预测提供了指引。

关键词

引用

@article{arxiv.2205.15853,
  title  = {Predicting Day-Ahead Stock Returns using Search Engine Query Volumes: An Application of Gradient Boosted Decision Trees to the S&P 100},
  author = {Christopher Bockel-Rickermann},
  journal= {arXiv preprint arXiv:2205.15853},
  year   = {2022}
}