多示例学习中的可复现性:算法单元测试的例证
机器学习
2023-10-30 v1 人工智能
机器学习
摘要
多示例学习(MIL)是分类问题的一个子领域,具有正、负标签及一袋输入;当且仅当袋中包含正例元素时标签为正,否则为负。此背景下的训练需要将袋级标签关联到实例级信息,并隐式包含因果假设及任务的不对称性(即不能在不改变语义的情况下交换标签)。MIL 问题出现在医疗健康(一个恶性细胞即指示癌症)、网络安全(一个恶意可执行文件即造成感染计算机)等诸多任务中。本工作中,我们考察了五种最突出的深度 MIL 模型,发现无一遵循标准 MIL 假设。它们能够学习反相关实例,即默认给出“正”标签直到看见负反例,而这对正确的 MIL 模型本不应可能。我们怀疑基于这些模型的改进及其他工作会共享同一问题。在任何使用这些模型的情境中,这都会造成学习到不正确模型的潜在风险,进而引发运行失败风险。我们通过提出的“算法单元测试”识别并演示该问题:我们创建合成数据集,可被遵循 MIL 的模型解决,并清晰揭示违反 MIL 假设的学习。五种被评估方法各自未能通过一项或多项此类测试。这提供了一种模型无关的方式来识别对建模假设的违背,我们希望其有助于 MIL 模型未来的开发与评估。
引用
@article{arxiv.2310.17867,
title = {Reproducibility in Multiple Instance Learning: A Case For Algorithmic Unit Tests},
author = {Edward Raff and James Holt},
journal= {arXiv preprint arXiv:2310.17867},
year = {2023}
}
备注
To appear in the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)