中文

基于强化学习的选择性伪标注方法用于半监督域适应

计算机视觉与模式识别 2020-12-08 v1

摘要

近期的域适应方法在无监督域适应问题上已展现出令人印象深刻的改进。然而,在目标域仅有少量有标签样本可用的半监督域适应(SSDA)设定下,这些方法可能无法提升性能。受伪标签在域适应中有效性的启发,我们提出了一种基于强化学习的选择性伪标注方法用于半监督域适应。传统伪标注方法难以平衡伪标注数据的正确性与代表性。为解决此局限,我们开发了一个深度 Q-learning 模型来筛选既准确又具代表性的伪标注样本。此外,受大间隔损失在少量数据上学习判别性特征能力的启发,我们进一步提出了一种新颖的目标间隔损失用于基模型训练以提升其判别力。我们所提方法在多个 SSDA 基准数据集上进行了评估,并展示出优于所有对比方法的性能。

关键词

引用

@article{arxiv.2012.03438,
  title  = {Selective Pseudo-Labeling with Reinforcement Learning for Semi-Supervised Domain Adaptation},
  author = {Bingyu Liu and Yuhong Guo and Jieping Ye and Weihong Deng},
  journal= {arXiv preprint arXiv:2012.03438},
  year   = {2020}
}