中文

潜在 MDP 中的前瞻性侧信息

机器学习 2023-10-12 v1 信息论 math.IT

摘要

在许多交互式决策场景中,存在固定不变的潜在且未观测到的信息。例如,考虑一个对话系统,其中关于用户的完整信息(如用户偏好)并未给出。在这样的环境中,潜在信息在每个回合中保持固定,因为用户的身份在交互过程中不会改变。这类环境可建模为潜在马尔可夫决策过程(Latent Markov Decision Process,LMDP),它是部分可观测马尔可夫决策过程(Partially Observed Markov Decision Processes,POMDPs)的一个特例。先前的工作确立了 LMDP 类在潜在上下文数量上的指数级下界。这就提出了一个问题:在哪些自然假设下,LMDP 的近最优策略可以被高效学习?在本工作中,我们研究具有{\em 前瞻性侧信息}的 LMDP 类,即智能体在每个回合开始时接收到关于潜在上下文的额外的、弱揭示的信息。我们表明,令人惊讶的是,该问题未被当代为部分可观测环境设计的设定与算法所涵盖。我们进而确立,任何样本高效算法必须承受至少 Ω(K2/3)\Omega(K^{2/3}) 的遗憾(regret),而非标准的 Ω(K)\Omega(\sqrt{K}) 下界,并设计了一个具有匹配上界的算法。

关键词

引用

@article{arxiv.2310.07596,
  title  = {Prospective Side Information for Latent MDPs},
  author = {Jeongyeol Kwon and Yonathan Efroni and Shie Mannor and Constantine Caramanis},
  journal= {arXiv preprint arXiv:2310.07596},
  year   = {2023}
}