中文

谁是更好的配对师?人类与算法在高风险创业竞赛中的裁判分配

人机交互 2025-10-15 v1 人工智能 计算与语言 计算机与社会 机器学习

摘要

对在需要语义理解和领域专业知识的上下文中将人工智能(AI)用于自动化和支持复杂决策的兴趣正在迅速增长。然而,仍不清楚算法如何与人类判断力进行比较。我们在裁判分配问题中进行了考察,即将提交物匹配到合适的资格裁判。这一问题在哈佛大学总统创新挑战中得到了解决,该竞赛是该校最具影响力的创业大赛,奖金超过50万美元,用于颁发给学生和校友的初创公司。我们开发了一种基于AI的裁判分配算法,称为混合词汇-语义相似性集合(Hybrid Lexical-Semantic Similarity Ensemble, HLSE),并在竞赛中部署了它。我们随后评估了其性能与人类专家分配的表现,方法是使用来自裁判的盲化匹配质量评分,对309个裁判-企业对进行评估。使用基于Mann-Whitney U统计量的检验,我们发现两种方法在分配质量之间没有统计显著差异(AUC=0.48, p=0.40);平均而言,算法匹配的评分是3.90,人工匹配的评分是3.94(满分5分),其中5表示优秀匹配。此外,之前需要满周的人工分配可在算法部署期间在数小时内自动化。这些结果表明,HLSE实现了人类专家水平的匹配质量,同时提供了更大的可扩展性和效率,凸显了AI驱动解决方案在高风险环境中支持和增强人类决策的潜力。

关键词

引用

@article{arxiv.2510.12692,
  title  = {Who is a Better Matchmaker? Human vs. Algorithmic Judge Assignment in a High-Stakes Startup Competition},
  author = {Sarina Xi and Orelia Pi and Miaomiao Zhang and Becca Xiong and Jacqueline Ng Lane and Nihar B. Shah},
  journal= {arXiv preprint arXiv:2510.12692},
  year   = {2025}
}

备注

17 Pages, 2 figures