无奖励的逆上下文赤字问题:通过后缀模仿学习来自非平稳学习者
机器学习
2026-03-05 v1 机器学习
摘要
我们研究逆上下文赤字(ICB)问题,即学习者寻求优化策略,而观察者无法访问学习者的奖励,仅观察动作,旨在恢复 underlying 问题参数。在学习过程中,学习者的行为从探索自然过渡到利用,导致非平稳动作数据,这对观察者构成重大挑战。为此,我们提出一种称为Two-Phase Suffix Imitation的简单有效框架。该框架丢弃初始燃烧阶段的数据,仅使用后续模仿阶段的数据进行经验风险最小化。我们推导了显式刻画燃烧长度选择引起的偏差-方差权衡的预测决策损失下界。尽管面临严重的信息不足,我们表明,奖励自由的观察者可实现的收敛率,匹配完全奖励感知学习者的渐近效率。这一结果表明,被动观察者仅凭动作就能有效地从中发现最优策略,达到与学习者本身相当的性能。
引用
@article{arxiv.2603.03778,
title = {Inverse Contextual Bandits without Rewards: Learning from a Non-Stationary Learner via Suffix Imitation},
author = {Yuqi Kong and Xiao Zhang and Weiran Shen},
journal= {arXiv preprint arXiv:2603.03778},
year = {2026}
}