中文

通过语义分割提升 3D 环境中的强化学习:以 ViZDoom 为例

机器学习 2026-05-29 v2 人工智能 机器人学

摘要

具有高维感知输入的 3D 环境中的强化学习 (RL) 提出两个主要挑战:(1) 由于稳定学习所需的记忆缓冲区而引起的高内存消耗,以及 (2) 部分可观测马尔可夫决策过程 (POMDPs) 中的学习复杂度。本项目通过提出两种新型输入表示来解决这些挑战:SS-only 和 RGB+SS,两者都采用对 RGB 彩色图像进行语义分割。在 ViZDoom 的死亡竞赛中进行了实验,采用完美的分割结果进行受控评估。我们的结果表明,SS-only 能够通过至少 66.6% 减少记忆缓冲区的内存消耗,up to 98.6% 降低内存消耗(当采用一种带有最小开销的可向量化无损压缩技术,如运行长度编码时)。同时,RGB+SS 通过提供额外的语义信息显著提升了 RL 代理的性能。此外,我们探索了基于密度的热力图作为可视化 RL 代理运动模式的工具,以评估其数据收集的适合性。与以前的方法的简要比较凸显了我们的方法如何克服了在 ViZDoom 等 3D 环境中应用语义分割的常见陷阱。

关键词

引用

@article{arxiv.2511.11703,
  title  = {Enhancing Reinforcement Learning in 3D Environments through Semantic Segmentation: A Case Study in ViZDoom},
  author = {Jin Huang},
  journal= {arXiv preprint arXiv:2511.11703},
  year   = {2026}
}

备注

Master's Thesis at the University of Edinburgh (2024)