中文

通过校准子集选择改进筛选流程

机器学习 2022-06-14 v3 计算机与社会 机器学习

摘要

许多筛选流程,例如寻找符合医学试验条件的患者或搜索引擎中的检索流水线,都由多个阶段组成,其中初始筛选阶段将资源集中于列出最有希望的候选者短名单。在本文中,我们研究一个筛选分类器能提供何种保证,而与其是手动构建还是训练得到无关。我们发现当前的解决方案不享有无分布的理论保证——我们表明,一般而言,即使对于一个完美校准的分类器,也总存在特定的候选者集合使其短名单是次优的。随后,我们开发了一种无分布的筛选算法——称为校准子集选择(CSS)——该算法在给定任意分类器和一定数量的校准数据的情况下,能找到近最优的候选者短名单,其在期望中包含所需数量的合格候选者。此外,我们展示了CSS的一个变体,通过对给定分类器在特定组上多次校准,可以创建具有可证明多样性保证的短名单。基于美国人口普查调查数据的实验验证了我们的理论结果,并表明我们算法提供的短名单优于多个有竞争力的基线。

关键词

引用

@article{arxiv.2202.01147,
  title  = {Improving Screening Processes via Calibrated Subset Selection},
  author = {Lequn Wang and Thorsten Joachims and Manuel Gomez Rodriguez},
  journal= {arXiv preprint arXiv:2202.01147},
  year   = {2022}
}

备注

International Conference on Machine Learning (ICML) 2022