中文

迭代经验风险最小化的渐近理论及其在主动学习中的应用

机器学习 2026-02-02 v1 机器学习

摘要

我们研究了一类迭代经验风险最小化(ERM)程序,其中在同一数据集上进行两次连续的ERM,第一估计器的预测结果作为第二个估计器损失函数的参数。这种设置在主动学习和再加权方案中自然出现,引入了跨样本的复杂统计依赖关系,使问题与经典单阶段ERM分析根本不同。在高维比例尺度下(即样本量和维度按比例扩展),对于在高斯混合数据上使用广泛凸损失函数训练的线性模型,我们推导出测试误差的尖锐渐近特征。我们的结果为第二个阶段估计器的性能提供了明确的、完全渐近的预测,尽管重复使用数据且存在预测相关损失。我们将该理论应用于重新审视一个经典的基于池的主动学习问题,消除先前工作中关于oracle假设和样本分割假设。我们发现标签预算在各阶段分配方式存在根本性的权衡,并演示了测试误差呈现双下降现象,这种双下降完全由数据选择引起,而非模型规模或样本数量。

关键词

引用

@article{arxiv.2601.23031,
  title  = {Asymptotic Theory of Iterated Empirical Risk Minimization, with Applications to Active Learning},
  author = {Hugo Cui and Yue M. Lu},
  journal= {arXiv preprint arXiv:2601.23031},
  year   = {2026}
}