中文

利用强化学习训练的智能体轨迹构建代理模型

机器学习 2025-09-03 v1 人工智能

摘要

在计算昂贵的模拟面前,样本效率是代理建模中普遍关注的问题。在具有宽广状态空间的模拟环境中,尽量减少所需样本数量的现有策略效果不佳。为应对这一挑战,我们提出了一种利用强化学习训练的策略来对确定性模拟环境进行高效采样的新方法。我们针对拉丁超立方抽样或主动学习与 Kriging 方法对这些代理模型构建策略进行了广泛分析,并对所有采样数据集进行了交叉验证性能比较。分析表明,包含由随机智能体、专家智能体以及被训练去探索状态转移分布最大熵区域的智能体所获取样本的混合数据集,在所有数据集中表现最佳,这对于有意义的状态空间表示至关重要。我们得出结论,所提出的方法改进了现有技术,并为在复杂模拟器上应用代理辅助的强化学习策略优化策略铺平了道路。

关键词

引用

@article{arxiv.2509.01285,
  title  = {Building surrogate models using trajectories of agents trained by Reinforcement Learning},
  author = {Julen Cestero and Marco Quartulli and Marcello Restelli},
  journal= {arXiv preprint arXiv:2509.01285},
  year   = {2025}
}

备注

Published in ICANN 2024 conference