中文

对抗注入下的可靠退让:紧下界与新上界

机器学习 2026-02-24 v1

摘要

我们研究在 Goel 等人 2017 年提出的对抗注入模型下在线学习问题,其中 labeled 示例序列主要来自未知分布 D\mathcal{D} 的 i.i.d. 采样,但可能掺杂有来自对抗者挑选的实例,学习者无法区分哪些轮次为对抗性。关键在于,标签始终与固定目标概念(干净标签情境)一致。学习者还可选择不进行预测,总体错误计数为学习者决定预测时所犯的错误以及在 i.i.d. 轮次中选择不预测所导致的错误。令人惊讶的是,先前工作表明,获得对分布的 oracle 访问可实现 O(d2logT)O(d^2 \log T) 的组合错误(VC 维为 dd),而分布无关算法仅能对受限类问题实现 O~(T)\tilde{O}(\sqrt{T}),这是否构成根本性差距尚未确定。我们通过证明 VC 维为 1 时的 Ω(T)\Omega(\sqrt{T}) 下界来解决这一问题,确立两种信息情境之间的尖锐分离。算法层面,我们引入基于潜在值的框架,驱动由“鲁棒见证人”(robust witnesses)驱动——这些见证人是一小类标签示例,既能认证预测,又能抵抗对抗性污染。我们使用两种组合维度实现该框架:(1)推理维度(inference dimension),可实现类推理维度为 kk 的组合误差 O~(T11/k)\tilde{O}(T^{1-1/k});(2)证书维度(certificate dimension),我们引入的新型松弛。作为应用,我们表明 R2\mathbb{R}^2 中的半空间证书维度为 3,获得该类的第一个分布无关界 O~(T2/3)\tilde{O}(T^{2/3})。这值得注意,因为 [Blum 等 2021] 表明,在无退让条件下,半空间在干净标签攻击下不可稳健学习。

关键词

引用

@article{arxiv.2602.20111,
  title  = {Reliable Abstention under Adversarial Injections: Tight Lower Bounds and New Upper Bounds},
  author = {Ezra Edelman and Surbhi Goel},
  journal= {arXiv preprint arXiv:2602.20111},
  year   = {2026}
}