中文

基于自编码器的自学习样本选择方法

机器学习 2019-12-03 v2 机器学习

摘要

自学习是一种利用大量无标签数据作为源样本以提升目标样本上任务性能的技术。与其他迁移学习技术相比,自学习因对源数据限制宽松可应用于更广泛的场景。然而,从与目标域关联不足的源样本迁移的知识可能对目标学习器产生负面影响,即所谓的负迁移。本文提出一种度量源样本与目标样本之间相关性的方法。具体而言,通过单层自编码器重构源样本与目标样本,并同时强制源样本与重构目标样本间存在线性关系。对变换矩阵施加 2,1\ell_{2,1}-范数稀疏约束以识别与目标域相关的源样本。被认为相关的源域样本被赋予反映其与目标域样本相关性的伪标签,并与目标样本结合以提供用于分类器训练的扩展训练集。在源样本选择过程中还通过谱图分析保持局部数据结构。大量实验中的良好结果展示了所提方法的优势。

关键词

引用

@article{arxiv.1808.01574,
  title  = {Autoencoder Based Sample Selection for Self-Taught Learning},
  author = {Siwei Feng and Han Yu and Marco F. Duarte},
  journal= {arXiv preprint arXiv:1808.01574},
  year   = {2019}
}

备注

38 pages, 4 figures, to appear in Elsevier Knowledge-Based Systems