一种改进的无模型决策-估计系数及其在对抗性 MDP 中的应用
机器学习
2026-03-20 v2
摘要
我们研究结构化观测下的决策制定(DMSO)。先前工作(Foster et al., 2021b, 2023a)通过决策-估计系数(DEC)刻画了 DMSO 的复杂度,但在遗憾上界和下界之间留下了随模型类规模缩放的差距。为缩小这一差距,Foster et al. (2023b) 引入了乐观 DEC,实现了仅随价值函数类规模缩放的界。然而,其基于乐观的探索仅已知能处理随机设置,尚不清楚它是否可扩展到对抗性设置。我们引入 Dig-DEC,一种无模型 DEC,去除了乐观性,仅通过信息增益驱动探索。Dig-DEC 始终不大于乐观 DEC,在特殊情况下可以小得多。重要的是,去除乐观性使其能够在没有显式奖励估计器的情况下处理对抗性环境。将 Dig-DEC 应用于具有随机转移和对抗性奖励的混合 MDP,我们在若干一般转移结构下获得了混合 MDP 在 Bandit 反馈下的首个无模型遗憾界,解决了 Liu et al. (2025) 留下的主要开放问题。我们还改进了无模型学习中的在线函数估计过程:对于平均估计误差最小化,我们改进了 Foster et al. (2023b) 中的估计器以实现更尖锐的集中,将其遗憾界从 改进到 (在线)和从 改进到 (离线)。对于 Bellman 完备 MDP 中的平方误差最小化,我们重新设计其双时间尺过程,将遗憾界从 改进到 。这是 DEC 方法首次在 Bellman 完备 MDP 中达到与基于乐观方法(Jin et al., 2021; Xie et al., 2023)相当的性能。
引用
@article{arxiv.2510.08882,
title = {An Improved Model-Free Decision-Estimation Coefficient with Applications in Adversarial MDPs},
author = {Haolin Liu and Chen-Yu Wei and Julian Zimmert},
journal= {arXiv preprint arXiv:2510.08882},
year = {2026}
}
备注
ICLR 2026