基于正类与未标记数据的异质域自适应
机器学习
2024-02-01 v2
摘要
异质无监督域自适应(HUDA)是最具挑战性的域自适应设定,其中源域和目标域的特征空间异质,且目标域仅有未标记数据。现有 HUDA 方法假设源域中同时有正例和负例可用,这在某些真实应用中可能无法满足。本文研究一种称为正类与未标记异质无监督域自适应(PU-HUDA)的新挑战性设定,即源域仅有正类的 HUDA 设定。PU-HUDA 也可视为 PU 学习的扩展,其中正类和未标记样本来自不同域。由于源域和目标域之间标签分布的差异,现有 HUDA 与 PU 学习方法的朴素组合在 PU-HUDA 中无效。为克服该问题,我们提出一种新方法——预测对抗域自适应(PADA),该方法可从未标记目标数据中预测可能的正例,并同时对齐特征空间以减小整个源数据与可能的目标正例数据之间的分布差异。PADA 通过统一的对抗训练框架实现:训练一个分类器预测正例,并训练一个特征变换器将目标特征空间变换到源域空间。具体而言,二者均被训练以欺骗一个共同的判别器,该判别器判断可能的正例是来自目标域还是源域。我们通过实验表明,PADA 优于若干基线方法,如 HUDA 与 PU 学习的朴素组合。
引用
@article{arxiv.2304.07955,
title = {Heterogeneous Domain Adaptation with Positive and Unlabeled Data},
author = {Junki Mori and Ryo Furukawa and Isamu Teranishi and Jun Sakuma},
journal= {arXiv preprint arXiv:2304.07955},
year = {2024}
}
备注
Accepted by IEEE Big Data 2023 as a regular paper