中文

受预算约束的主动学习:有效去抗 censorship 的生存数据方法

机器学习 2025-10-15 v1 人工智能

摘要

标准监督学习器试图从标记数据集中学习模型。给定一小部分已标记实例和一批未标记实例后,预算受限的学习器可利用其给定的预算来支付获取某些未标记实例标签的费用,然后利用这些标签来生成模型。本文探讨了在生存数据集(包含(右)抗 censorship 实例的情形,即仅知实例的生存时间下界)上的预算学习。在这种情况下,学习器可支付费用来(部分)标记抗 censorship 实例——例如获取实例实际的生存时间[或许从(3年,抗 censorship)变为(7.2年,未抗 censorship)],或其他变体[例如获取一年信息,因此从(3年,抗 censorship)变为(4年,抗 censorship)或(3.2年,未抗 censorship)]。这可视为真实世界数据收集的模型,其中对抗 censorship 患者的随访并不总能消除抗 censorship,数据收集期间向学习器模型提供的信息量是预算及数据本身性质的函数。我们提供了针对如何将最新预算学习算法应用于生存数据及其相应局限性的实验和理论结果。我们的方法提供了与标准主动学习方法BatchBALD等价的上界和时间复杂度。此外,实证分析表明,在多个生存任务上,我们的方法在多个基准测试中优于其他潜在方法。

关键词

引用

@article{arxiv.2510.12144,
  title  = {Budget-constrained Active Learning to Effectively De-censor Survival Data},
  author = {Ali Parsaee and Bei Jiang and Zachary Friggstad and Russell Greiner},
  journal= {arXiv preprint arXiv:2510.12144},
  year   = {2025}
}