基于简单问题的主动学习
机器学习
2024-06-11 v2 数据结构与算法
摘要
我们考虑一种主动学习设置,其中学习者面临来自域 X 的 n 个未标记样本集合 S,并通过查询来寻找与目标概念 h^* \in H 一致的标记。在传统主动学习仅查询单个样本标签的基础上,我们研究更一般的区域查询,允许学习者选择域的子集 T \subset X 和目标标签 y,询问标签器 whether h^*(x) = y 是否为 T \cap S 中每个样本的标签。这种更强大的查询方式使我们能够绕过传统主动学习的局限性,并使用显著更少的交互轮数来学习,但可能导致查询语言更为复杂。我们的主要贡献在于量化查询数量与查询语言复杂度之间的权衡。我们通过族区域的 VC 维来衡量区域查询的复杂度。我们证明,对于任何具有 VC 维为 d 的假设类 H,都可以设计一个具有 VC 维为 O(d) 的区域查询族 Q,使得对于任意大小为 n 的样本集 S \subset X 和任意 h^* \in H,学习者可以提交 O(d log n) 个来自 Q 的查询给标签器,以完美地标记 S。我们通过设计一个具有 VC 维为 d 的假设类 H 和大小为 n 的数据集 S \subset X,给出匹配的下界,使得任何使用 VC 维小于 O(d) 的查询类进行学习的算法必须对 S 进行 poly(n) 个查询才能完美标记。最后,我们聚焦于已知的假设类,包括区间的并集、高维矩形箱和 d 维半空间,并获得更强的结果。具体而言,我们设计的学习算法能够(i)计算上高效,且(ii)即使查询不是基于学习者的样本池 S 而是基于某个未知超集 L \supset S 时也能工作。
引用
@article{arxiv.2405.07937,
title = {Active Learning with Simple Questions},
author = {Vasilis Kontonis and Mingchen Ma and Christos Tzamos},
journal= {arXiv preprint arXiv:2405.07937},
year = {2024}
}
备注
To appear at COLT 2024