中文

一种面向无已知变化点非平稳环境中深度强化学习的行为感知方法

机器学习 2024-05-24 v1 人工智能

摘要

深度强化学习被用于各个领域,但通常假设环境具有平稳的条件,如转移和状态分布。当这一假设不成立时,性能会受到影响。因此,跟踪连续的环境变化并适应不可预测的条件具有挑战性但至关重要,因为它确保系统在实际场景中保持可靠和灵活。我们的研究引入了行为感知检测与适应(BADA),一个将环境变化检测与行为适应相结合的创新框架。我们方法背后的关键灵感是,策略在变化的环境中表现出不同的全局行为。具体来说,通过使用Wasserstein距离分析行为之间的变化来识别环境变化,无需手动设置阈值。模型通过基于变化程度的行为正则化来适应新环境。一系列实验的结果表明,与几种当前算法相比,我们的方法具有更好的性能。这项研究也表明了解决这一长期挑战的巨大潜力。

关键词

引用

@article{arxiv.2405.14214,
  title  = {A Behavior-Aware Approach for Deep Reinforcement Learning in Non-stationary Environments without Known Change Points},
  author = {Zihe Liu and Jie Lu and Guangquan Zhang and Junyu Xuan},
  journal= {arXiv preprint arXiv:2405.14214},
  year   = {2024}
}

备注

Accepted by IJCAI 2024