面向线性回归的无监督基于池的主动学习
机器学习
2020-01-16 v1 机器学习
摘要
在许多现实世界的机器学习应用中,未标记数据可以轻易获得,但标记它们非常耗时和/或昂贵。因此,希望能够选择最优样本进行标记,从而用最少量的标记数据训练出良好的机器学习模型。主动学习(AL)已广泛为此目的而使用。然而,大多数现有的 AL 方法是有监督的:它们从小量标记样本训练初始模型,基于该模型查询新样本,然后迭代更新模型。它们中很少考虑完全无监督的 AL 问题,即从零开始,在完全不知道任何标签信息的情况下,如何最优地选择最开始的少数样本进行标记。该问题极具挑战性,因为无法利用任何标签信息。本文研究面向线性回归问题的无监督基于池的主动学习。我们提出了一种新颖的 AL 方法,同时考虑信息性、代表性和多样性这三个 AL 中的基本准则。在来自不同应用领域的 14 个数据集上,使用三种不同的线性回归模型(岭回归、LASSO 和线性支持向量回归)进行的广泛实验,证明了我们所提方法的有效性。
引用
@article{arxiv.2001.05028,
title = {Unsupervised Pool-Based Active Learning for Linear Regression},
author = {Ziang Liu and Dongrui Wu},
journal= {arXiv preprint arXiv:2001.05028},
year = {2020}
}