中文

基于 PAC-Bayes 风险的嵌套因果bandit认证策略优化

人工智能 2026-05-29 v1 机器学习

摘要

关键的顺序决策几乎总是多尺度进行的:一个战略决策因果地塑造了后续每一步战术选择所处的上下文;标准的bandit和强化学习理论无法捕捉不同尺度之间的因果耦合。我们将问题类正式表述为嵌套情境因果bandit(NCCBs),这是一个层次结构的因果结构模型,其中每个层次的动作集合设置下一个层次的情境分布,并提出嵌套因果 Thompson 采样(NCTS),该方法为每个回合抽取一个机制-因子化信念,并在其下递归行动。我们的主要理论结果是一种因果 PAC-Bayes 剩余风险界,从历史数据中对任何候选部署策略进行认证,无需在策略外,且随时可用,回答部署问题:我们可以在这里信任这个智能体,以及它的风险是多少?在层次结构SCM的实验中,与在相同函数类上进行匹配的RFF-GP联合回归相比,因子化SCM-机制后验在外生分布迁移下显著更好地进行零样本迁移,递归的meta-to-inner提交在分布内显著优于联合提交方案,而且随着离线数据积累,证书显著收缩。结合这些结果,我们建立了渐进式认证移交,一种安全部署方法:每个尺度都从旧版控制器切换到NCTS,当收益可以被认证时,而不管其他尺度如何。

关键词

引用

@article{arxiv.2605.29788,
  title  = {Certified Policy Optimisation for Nested Causal Bandits via PAC-Bayes Risk},
  author = {Tim Woydt and Paul-David Zuercher},
  journal= {arXiv preprint arXiv:2605.29788},
  year   = {2026}
}