不要按下按钮!探索机器学习与迁移学习中的数据泄露风险
机器学习
2025-08-21 v5 人工智能
摘要
机器学习(ML)已经彻底改变了各个领域,在多个领域提供了预测能力。然而,随着 ML 工具的可及性日益增加,许多缺乏深厚 ML 专业知识的从业者采用了一种“按下按钮”的方法,即利用用户友好的界面,而无需深入理解底层算法。虽然这种方法提供了便利,但它引发了对结果可靠性的担忧,导致了诸如性能评估不正确等挑战。本文解决了机器学习中一个被称为数据泄露的关键问题,即非预期的信息污染了训练数据,影响了模型性能评估。由于缺乏理解,用户可能会无意中忽略关键步骤,导致乐观的性能估计,这些估计在现实场景中可能不成立。评估性能与新数据上实际性能之间的差异是一个重大关切。特别是,本文对机器学习中的数据泄露进行了分类,讨论了某些条件如何通过机器学习工作流传播。此外,它还探讨了数据泄露与所处理的具体任务之间的联系,调查了其在迁移学习中的发生情况,并比较了标准归纳式机器学习与直推式机器学习框架。结论总结了关键发现,强调了解决数据泄露问题对于构建稳健可靠的机器学习应用的重要性。
引用
@article{arxiv.2401.13796,
title = {Don't Push the Button! Exploring Data Leakage Risks in Machine Learning and Transfer Learning},
author = {Andrea Apicella and Francesco Isgrò and Roberto Prevete},
journal= {arXiv preprint arXiv:2401.13796},
year = {2025}
}
备注
Published on Artificial Intelligence Review journal. The paper is in Open Access available at https://link.springer.com/article/10.1007/s10462-025-11326-3