中文

规模化的逆监督:指数搜索遇上标注经济学

机器学习 2025-12-19 v2 人工智能

摘要

我们分析了一种反向监督策略,即在大型未标记集合 BB 上搜索标签,以最小化在小型标记集合 AA 上的误差。搜索空间为 2n2^n,即使在大常数因子加速(如量子或大规模并行硬件)下,复杂度仍为指数级。因此,任意快速——但不指数级更快——的计算并不能消除对信息标签或先验知识的需求。实际中,机器学习管道仍需要初始的人类贡献:指定目标、定义类别、提供一小套代表性注释,以注入归纳偏置并将模型与任务语义对齐。来自生成式 AI 的合成标签可在其质量达到人类水平并以人类指定的目标、初始监督和验证为锚定的情况下,部分取代人类输入。在这种观点下,生成模型充当“标签放大器”,通过主动学习、半监督和自训练循环利用小型人类精选核心,同时人类保留校准、漂移检测和故障审计的监督。因此,极端计算速度缩短了墙钟时间,但并未消除学习的根本监督需求;初始的人类(或人类质量)输入仍是将系统锚定在预期任务上的必要条件。

关键词

引用

@article{arxiv.2510.10446,
  title  = {Reverse Supervision at Scale: Exponential Search Meets the Economics of Annotation},
  author = {Masoud Makrehchi},
  journal= {arXiv preprint arXiv:2510.10446},
  year   = {2025}
}

备注

10 pages