SADA:半监督学习中多个黑盒预测的安全自适应聚合
机器学习
2026-05-29 v3 机器学习
统计方法学
摘要
在实践中,当标注数据稀缺或获取成本高昂,而大量未标注数据易于获取时,便会出现半监督学习(SSL)。随着机器学习技术的日益普及,利用多种模型与算法(包括深度学习、大语言模型和生成式 AI)生成多个预测标签已变得愈发可行。在本文中,我们提出了一种新方法,能够针对推断与预测任务,安全且自适应地聚合质量不确定的多个黑盒预测。我们的方法提供了两个关键保证: 无论预测质量如何,其表现绝不逊于仅使用标注数据; 如果任意一个预测(在不知晓具体是哪一个的情况下)能完美拟合真实值,该算法会自适应地利用这一点,以实现更快的收敛速度或半参数有效界。我们通过小规模模拟和两项具有不同科学目标的真实数据分析,验证了所提算法的有效性。我们提供了一个易于使用的 R 语言包 sada,以方便实际应用。
引用
@article{arxiv.2509.21707,
title = {SADA: Safe and Adaptive Aggregation of Multiple Black-Box Predictions in Semi-Supervised Learning},
author = {Jiawei Shan and Zhifeng Chen and Yiming Dong and Yazhen Wang and Jiwei Zhao},
journal= {arXiv preprint arXiv:2509.21707},
year = {2026}
}