中文

当职业数据耗尽时:面向创始人成功预测的结构化特征工程与信号极限

机器学习 2026-04-02 v1

摘要

从创始人职业数据预测创业成功是困难的。信号微弱,标签稀缺(9%),且大多数成功的创始人与失败的创始人几乎无法区分。我们直接从原始JSON字段(职位、教育、退出等)工程化28个结构化特征,并将其与确定性规则层和XGBoost提升桩相结合。模型达到Val F0.5 = 0.3030,Precision = 0.3333,Recall = 0.2222——相比零样本LLM基线提升17.7个百分点。随后我们进行了对照实验:使用Claude Haiku从散文字段提取9个特征,覆盖率为67%和100%。LLM特征捕获了26.4%的模型重要性,但未增加任何交叉验证信号(delta = -0.05pp)。原因在于结构层面:anonymised_prose是由我们直接解析的同一JSON字段生成的——它是一种有损重编码,而非更丰富的信息源。上限(CV ≈ 0.25,Val ≈ 0.30)反映了该数据集的信息含量,而非建模局限。在刻画信号何处耗尽及其原因的过程中,本工作充当基准诊断——直接指向更丰富的数据集需要包含什么。

关键词

引用

@article{arxiv.2604.00339,
  title  = {When Career Data Runs Out: Structured Feature Engineering and Signal Limits for Founder Success Prediction},
  author = {Yagiz Ihlamur},
  journal= {arXiv preprint arXiv:2604.00339},
  year   = {2026}
}

备注

4 pages, 4 tables. Accepted at SecureFinAI Contest @ IEEE IDS 2026. Code: https://github.com/ihlamury/vcbench