基于数据剪枝的无监督域适应
机器学习
2024-09-19 v1
摘要
从训练数据中移除精心挑选的样本最近成为提高机器学习模型鲁棒性的有效方法之一。然而,如何选择这些样本仍是一个未解决的问题。本文从无监督域适应 (UDA) 的角度来考虑这一问题。我们提出了 AdaPrune—a一种用于 UDA 的方法,通过移除训练样本以尝试将训练分布对齐到目标数据分布。通过采用最大均值差异 (MMD) 作为对齐准则,该问题可以简洁地形式化并解作为一个整数二次规划问题。我们在真实的生物声学事件检测领域迁移任务上对方法进行评估。作为一种 UDA 方法,我们展示了 AdaPrune 在许多相关技术基础上优于表现,并与诸如 CORAL 等其他 UDA 算法是互补的。我们对 MMD 与模型准确率之间关系的分析,以及 t-SNE 图,验证了该方法作为执行数据剪枝的原则性且合理的做法。
引用
@article{arxiv.2409.12076,
title = {Unsupervised Domain Adaptation Via Data Pruning},
author = {Andrea Napoli and Paul White},
journal= {arXiv preprint arXiv:2409.12076},
year = {2024}
}