中文

抽象地理特定地形以扩展强化学习

机器学习 2025-03-27 v1 人工智能 多智能体系统

摘要

多智能体强化学习 (MARL) 正在越来越广泛地用于训练用于地理特定地形中动态和自适应合成角色的交互式模拟。诸如 Unity 的 ML-Agents 等框架有助于使此类强化学习实验更易于模拟社区使用。军事训练模拟也受益于 MARL 的进展,但由于其复杂、连续、随机、部分可观测、非平稳和基于 doctrine 的本质,这些模拟具有巨大的计算需求。此外,这些模拟需要地理特定地形,进一步恶化了计算资源问题。在我们的研究中,我们利用 Unity 的 waypoint 来自动生成地理特定地形的多层表示抽象,以在仍允许在不同表示之间传递已学习的策略的同时扩展强化学习。我们的早期探索性结果在一个新颖的 MARL 场景中表现良好,该场景中每一方都有不同的目标,表明 waypoint-based navigation 使学习更快更有效,同时产生类似专家人类玩家在 CSGO 环境中所采取的轨迹。这项研究指出了利用 waypoint-based navigation 降低开发和训练 MARL 模型用于军事训练模拟中计算成本的潜力,而该模拟中地理特定地形和不同目标至关重要。

关键词

引用

@article{arxiv.2503.20078,
  title  = {Abstracting Geo-specific Terrains to Scale Up Reinforcement Learning},
  author = {Volkan Ustun and Soham Hans and Rajay Kumar and Yunzhe Wang},
  journal= {arXiv preprint arXiv:2503.20078},
  year   = {2025}
}

备注

10 pages, 6 figures, 2024 Interservice/Industry Training, Simulation, and Education Conference (I/ITSEC)