中文

随机规则森林(RRF):用于预测初创企业成功的LLM生成问题可解释集成

人工智能 2025-09-17 v2 机器学习

摘要

预测初创企业成功等罕见结果是风险投资的核心,需要既准确又可解释的模型。我们提出了随机规则森林(RRF),这是一种轻量级集成方法,利用大语言模型(LLM)生成简单的自然语言YES/NO问题。每个问题作为一个弱学习器,其响应通过基于阈值的投票规则结合,形成强大且可解释的预测器。应用于包含9,892名创始人的数据集,RRF在留出数据上比随机基线提高了6.9倍;加入专家设计的问题后,这一提升达到8倍,并突显了人机协作的价值。与三种LLM架构上的零样本和少样本基线相比,RRF的F0.5达到0.121,而最佳基线为0.086(绝对值+0.035,相对值+41%)。通过将LLM的创造力与集成学习的严谨性相结合,RRF提供了适用于高风险领域决策的可解释、高精度预测。

关键词

引用

@article{arxiv.2505.24622,
  title  = {Random Rule Forest (RRF): Interpretable Ensembles of LLM-Generated Questions for Predicting Startup Success},
  author = {Ben Griffin and Diego Vidaurre and Ugur Koyluoglu and Joseph Ternasky and Fuat Alican and Yigit Ihlamur},
  journal= {arXiv preprint arXiv:2505.24622},
  year   = {2025}
}

备注

13 pages including appendix, 4 figures