半监督主动回归
机器学习
2021-06-15 v1
摘要
标注数据往往代价高昂,因为它可能需要招募人工标注者或进行昂贵实验。同时,在许多实际场景中,人们已经拥有一个部分标注、可能存在偏差的数据集,可帮助处理手头的学习任务。受此类设置驱动,我们通过线性回归框架正式开启了 的研究。在该设置中,学习器可访问数据集 ,其由 个算法可主动查询的未标注样本与 个先验标注样本组成。具体而言,记真实标签为 ,学习器的目标是找到 使得 \begin{equation} \| X \widehat{\beta} - Y \|_2^2 \le (1 + \epsilon) \min_{\beta \in \mathbb{R}^d} \| X \beta - Y \|_2^2 \end{equation} 同时进行尽可能少的额外标签查询。为界定标签查询量,我们引入一个实例相关参数称为约简秩,记为 ,并提出查询复杂度为 的高效算法。该结果直接意味着两个重要特例的改进上界:(i) 主动岭回归,与 (ii) 主动核岭回归,其中约简秩分别等同于问题的统计维度 与有效维度 ,这里 表示正则化参数。对于主动岭回归,我们还证明了任何算法的查询复杂度下界为 。这涵盖了先前仅考虑无正则化情形即 的工作。
引用
@article{arxiv.2106.06676,
title = {Semi-supervised Active Regression},
author = {Fnu Devvrit and Nived Rajaraman and Pranjal Awasthi},
journal= {arXiv preprint arXiv:2106.06676},
year = {2021}
}