面向部分可观测域中鲁棒策略的对抗性潜在状态训练
机器学习
2026-03-20 v3 人工智能
机器学习
摘要
在部分可观测强化学习中,对潜在分布偏移的鲁棒性仍然是一个挑战。我们形式化了一个聚焦场景,其中对手在情节开始前选择一个隐藏的初始潜在分布,称为对抗性潜在初始状态POMDP。理论上,我们证明了一个潜在极小极大原理,刻画了最坏情况下的防御者分布,并推导了具有有限样本集中界限的近似最佳响应不等式,这些不等式使优化和采样项显式化。实证上,使用战舰基准测试,我们证明,针对偏移潜在分布的目标暴露,在相同预算下,将Spread和Uniform分布之间的平均鲁棒性差距从10.3次射击降低到3.1次射击。此外,迭代最佳响应训练表现出对预算敏感的行为,在考虑折扣PPO代理和有限样本噪声后,该行为在定性上与定理指导的诊断一致。最终,我们表明,对于潜在初始状态问题,该框架产生了一个清晰的评估博弈和有用的定理激励的诊断,同时也明确了实现层面的代理和优化限制在何处介入。
引用
@article{arxiv.2603.07313,
title = {Adversarial Latent-State Training for Robust Policies in Partially Observable Domains},
author = {Angad Singh Ahuja},
journal= {arXiv preprint arXiv:2603.07313},
year = {2026}
}
备注
30 pages, 8 figures