中文

无奖励的逆上下文赤字问题:通过后缀模仿学习来自非平稳学习者

机器学习 2026-03-05 v1 机器学习

摘要

我们研究逆上下文赤字(ICB)问题,即学习者寻求优化策略,而观察者无法访问学习者的奖励,仅观察动作,旨在恢复 underlying 问题参数。在学习过程中,学习者的行为从探索自然过渡到利用,导致非平稳动作数据,这对观察者构成重大挑战。为此,我们提出一种称为Two-Phase Suffix Imitation的简单有效框架。该框架丢弃初始燃烧阶段的数据,仅使用后续模仿阶段的数据进行经验风险最小化。我们推导了显式刻画燃烧长度选择引起的偏差-方差权衡的预测决策损失下界。尽管面临严重的信息不足,我们表明,奖励自由的观察者可实现O~(1/N)\tilde O(1/\sqrt{N})的收敛率,匹配完全奖励感知学习者的渐近效率。这一结果表明,被动观察者仅凭动作就能有效地从中发现最优策略,达到与学习者本身相当的性能。

关键词

引用

@article{arxiv.2603.03778,
  title  = {Inverse Contextual Bandits without Rewards: Learning from a Non-Stationary Learner via Suffix Imitation},
  author = {Yuqi Kong and Xiao Zhang and Weiran Shen},
  journal= {arXiv preprint arXiv:2603.03778},
  year   = {2026}
}