中文

半监督主动回归

机器学习 2021-06-15 v1

摘要

标注数据往往代价高昂,因为它可能需要招募人工标注者或进行昂贵实验。同时,在许多实际场景中,人们已经拥有一个部分标注、可能存在偏差的数据集,可帮助处理手头的学习任务。受此类设置驱动,我们通过线性回归框架正式开启了 半监督半监督 主动主动 学习学习 的研究。在该设置中,学习器可访问数据集 XR(n1+n2)×dX \in \mathbb{R}^{(n_1+n_2) \times d},其由 n1n_1 个算法可主动查询的未标注样本与 n2n_2 个先验标注样本组成。具体而言,记真实标签为 YRn1+n2Y \in \mathbb{R}^{n_1 + n_2},学习器的目标是找到 β^Rd\widehat{\beta} \in \mathbb{R}^d 使得 \begin{equation} \| X \widehat{\beta} - Y \|_2^2 \le (1 + \epsilon) \min_{\beta \in \mathbb{R}^d} \| X \beta - Y \|_2^2 \end{equation} 同时进行尽可能少的额外标签查询。为界定标签查询量,我们引入一个实例相关参数称为约简秩,记为 RXR_X,并提出查询复杂度为 O(RX/ϵ)O(R_X/\epsilon) 的高效算法。该结果直接意味着两个重要特例的改进上界:(i) 主动岭回归,与 (ii) 主动核岭回归,其中约简秩分别等同于问题的统计维度 sdλsd_\lambda 与有效维度 dλd_\lambda,这里 λ0\lambda \ge 0 表示正则化参数。对于主动岭回归,我们还证明了任何算法的查询复杂度下界为 O(sdλ/ϵ)O(sd_\lambda / \epsilon)。这涵盖了先前仅考虑无正则化情形即 λ=0\lambda = 0 的工作。

关键词

引用

@article{arxiv.2106.06676,
  title  = {Semi-supervised Active Regression},
  author = {Fnu Devvrit and Nived Rajaraman and Pranjal Awasthi},
  journal= {arXiv preprint arXiv:2106.06676},
  year   = {2021}
}