面向单智能体与多智能体强化学习的循环神经网络概率验证
人工智能
2026-05-15 v1
摘要
由循环神经网络(RNN)诱导的依赖历史的策略依赖于潜在隐藏状态动态,使得部分可观测强化学习(RL)中的验证具有挑战性。现有的RNN验证工具通常依赖于严格的建模假设或对隐藏状态空间的粗略过近似,这可能导致过于保守或无定论的结果。我们提出了 babilistic rification(),一个概率框架,用于基于RNN的策略中不良行为的。使用策略驱动的采样来近似在已训练策略下可行的隐藏状态集合,并推导出统计误差界限,以产生有界误差、高置信度的行为违规估计。在部分可观测单智能体和协作多智能体任务上的实验表明,与现有工具相比,提供了更具定量性、感知可行性的概率保证,同时可扩展至循环和多智能体环境。
引用
@article{arxiv.2605.14758,
title = {Probabilistic Verification of Recurrent Neural Networks for Single and Multi-Agent Reinforcement Learning},
author = {Luca Marzari and Enrico Marchesini},
journal= {arXiv preprint arXiv:2605.14758},
year = {2026}
}
备注
Accepted at the 35th International Joint Conference on Artificial Intelligence (IJCAI) 2026