基于伪标签的集成多源域适应
机器学习
2020-10-01 v1 机器学习
摘要
给定多个带标签的源数据集,我们如何训练一个没有标签数据的目标模型?多源域适应(MSDA)旨在缺乏目标数据标签的情况下,使用不同于目标数据集的多个源数据集训练模型。MSDA 是一个关键问题,适用于许多由于隐私问题目标数据标签不可用的实际场景。现有 MSDA 框架存在局限,因为它们在对齐数据时未考虑每个域的条件分布 p(x|y)。它们也因完全不考虑目标标签且仅依赖单一特征提取器而遗漏了大量目标标签信息。本文中,我们提出基于伪标签的集成多源域适应(EnMDAP),一种用于多源域适应的新方法。EnMDAP 利用按标签的矩匹配来对齐条件分布 p(x|y),对不可用的目标标签使用伪标签,并通过使用多个特征提取器引入集成学习思路以实现准确的域适应。大量实验表明,EnMDAP 在图像域与文本域的多源域适应任务中均提供了最先进的(SOTA)性能。
引用
@article{arxiv.2009.14248,
title = {Ensemble Multi-Source Domain Adaptation with Pseudolabels},
author = {Seongmin Lee and Hyunsik Jeon and U Kang},
journal= {arXiv preprint arXiv:2009.14248},
year = {2020}
}