VCBench: 评估 LLM 在风险投资领域预测创始人成功的基准测试
人工智能
2026-05-06 v2
摘要
诸如 SWE-bench 和 ARC-AGI 等基准测试表明,共享数据集加速了人工通用智能(AGI)的进程。我们引入 VCBench,这是第一个针对预测风险投资领域创始人成功情况的基准测试,该领域的信号稀疏、结果不确定,即使是顶级投资者的表现也有限。在创始人成立之初,市场指数实现 1.9% 的精确率。Y Combinator 以 1.7 倍的优势超越该指数,而一级机构投资者则优势更大,达到 2.9 倍。VCBench 提供了 9000 条匿名化的创始人档案,标准化处理以保留预测特征,同时抵御身份泄露风险,敌对测试显示其识别风险降低超过 90%。我们评估了九个最先进的大型语言模型(LLM)。DeepSeek-V3 实现了超过 6 倍的基线精度,GPT-4o 实现了最高的 F0.5 分数,而大多数模型均超越了人类基准。作为可公开获取且持续演进的资源,VCBench 于 vcbench.com 提供,确立了社区驱动的、可复现且在早期风险投资预测中保护隐私的 AGI 评估标准。
引用
@article{arxiv.2509.14448,
title = {VCBench: Benchmarking LLMs in Venture Capital},
author = {Rick Chen and Joseph Ternasky and Afriyie Samuel Kwesi and Ben Griffin and Aaron Ontoyin Yin and Zakari Salifu and Kelvin Amoaba and Xianling Mu and Fuat Alican and Yigit Ihlamur},
journal= {arXiv preprint arXiv:2509.14448},
year = {2026}
}