用机器学习方法解决初创企业成功预测中的数据稀疏问题
机器学习
2021-12-16 v1 计算与语言
计量经济学
摘要
预测初创企业的成功对初创企业和投资者都具有重要意义。由于可用数据和相关通用方法的缺乏,该任务十分困难。随着 Crunchbase 等数据平台汇聚初创企业信息,利用机器学习算法进行预测成为可能。现有研究受困于数据稀疏问题,因为大多数早期初创企业没有太多公开可用数据。我们尝试借助近期算法解决该问题。我们利用来自 Crunchbase 的大规模数据集考察了若干机器学习算法。结果表明,LightGBM 和 XGBoost 表现最佳,F1 分数分别达到 53.03% 和 52.96%。我们从特征贡献的角度对预测结果进行了解释。我们基于模型构建投资组合并取得了较高的成功率。这些发现对机器学习方法如何助力初创企业和投资者具有实质性启示。
引用
@article{arxiv.2112.07985,
title = {Solving the Data Sparsity Problem in Predicting the Success of the Startups with Machine Learning Methods},
author = {Dafei Yin and Jing Li and Gaosheng Wu},
journal= {arXiv preprint arXiv:2112.07985},
year = {2021}
}