中文

面对未知延迟和对抗性损坏的鲁棒线性二战频带

机器学习 2026-05-20 v3

摘要

我们研究线性二战频带在波动环境中的问题,该环境同时包含事后上下文、延迟反馈和对抗性损坏。反馈受到未知的随机或对抗性延迟,以及累积损坏预算 C\mathcal{C}。为解决这些挑战,我们提出了 \term{} 方法,该方法集成了一个学习的近似器,用于从事前信息预测事后上下文。进一步采用自适应加权策略,对特征向量进行裁剪,以同时缓解被损坏和延迟观察的影响。在标准的正则性条件下以及参数化的事后映射下,我们严格地证明了该算法是延迟法域无关的,实现的失效上界为 O~(d(T+C+D))\widetilde{\mathcal{O}}(d(\sqrt{T} + \mathcal{C} + \mathcal{D})),其中 dd 为总特征维数,D\mathcal{D} 封装了延迟复杂度。关键在于,我们的分析揭示了损坏与延迟之间的加性成本结构,避免了以往方法典型的乘法退化。我们进一步建立下界,这些下界在无事后上下文情况下针对对抗性延迟几乎匹配我们的上界,差距仅为 d\sqrt{d} 因子。

关键词

引用

@article{arxiv.2605.01752,
  title  = {Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions},
  author = {Youngmin Oh},
  journal= {arXiv preprint arXiv:2605.01752},
  year   = {2026}
}