中文

带延迟反馈的线性与神经对抗性多臂盒子问题

机器学习 2026-05-27 v1 人工智能

摘要

情境性对抗性多臂盒子是偏好基于决策的基石,具有在推荐系统和大型语言模型对齐方面的关键应用。然而,标准算法依赖于理想化的即时反馈假设,这在现实场景中常被违反,例如在提示优化中。这种设定引入了独特的理论挑战:与线性多臂盒子不同,对抗性盒子估计器缺乏闭式解,导致对标准加权技术的简单化应用会产生偏差。为此,我们正式化了具有随机延迟反馈的情境性对抗性盒子问题,提出两种新算法:线性(LDB-DF)和神经(NDB-DF)带延迟反馈的对抗性盒子。我们方法的核心是一种新型估计器,直接将逆概率加权(IPW)机制集成到损失函数中,以确保对延迟或缺失反馈的无偏修正。我们提供了全面的理论分析,建立了线性情形下的O(d*sqrt(T)) regret 上界,并为神经情形提供亚线性保证。大量在模拟数据和真实数据上的实验表明,我们提出的方法有效。

关键词

引用

@article{arxiv.2605.26554,
  title  = {Linear and Neural Dueling Bandits with Delayed Feedback},
  author = {Xiangyi Wang and Pingchen Lu and Jie Mao and Mingze Kong and Zhi Hong and Zhiyong Wang and Zhongxiang Dai},
  journal= {arXiv preprint arXiv:2605.26554},
  year   = {2026}
}