中文

STORI:随机环境的基准测试与分类

机器学习 2025-10-06 v2 人工智能

摘要

强化学习(RL)技术在模拟基准测试(如Atari100k)中取得了令人印象的成绩,但近期进展仍主要局限于仿真环境,难以迁移到实际应用领域。中心性障碍在于环境随机性,因为实际系统涉及噪声观测、不可预测的动力学以及非平稳条件,这些都会削弱当前方法的稳定性。现有基准测试很少捕捉这些不确定性,倾向于简化环境,使得算法能够成功。缺乏随机性的明确分类进一步复杂化了评估,因为对一种随机扰动(如黏性动作)的鲁棒性并不保证对其他形式不确定性的鲁棒性。为此,我们引入STORI(STOchastic-ataRI),一个系统性地整合多种随机效应的数据集,使RL技术能够在不同形式的不确定性下进行严格评估。我们提出了环境随机性的五类型分类法,并通过针对性评估DreamerV3和STORM模型,揭示了最先进模型基准RL算法的系统性脆弱性。我们的发现表明,世界模型在环境方差估计上严重低估,难以处理动作损坏,在部分可见性下动力学不可靠。我们公开代码和基准测试(https://github.com/ARY2260/stori),为开发更稳健的RL系统提供统一框架。

关键词

引用

@article{arxiv.2509.01793,
  title  = {STORI: A Benchmark and Taxonomy for Stochastic Environments},
  author = {Aryan Amit Barsainyan and Jing Yu Lim and Dianbo Liu},
  journal= {arXiv preprint arXiv:2509.01793},
  year   = {2025}
}

备注

v2. New mathematical formulation and renamed notation; added additional experiments and a detailed analytical case study on error behaviors in world models under different stochasticity types; link to code repository for reproducibility: https://github.com/ARY2260/stori