基于查询的语义高斯场用于强化学习中的场景表示
机器人学
2024-09-30 v4
摘要
潜在场景表示在训练强化学习(RL)智能体中起着重要作用。为了获得描述场景的良好潜在向量,最近的工作将3D感知的潜在条件NeRF管道整合到场景表示学习中。然而,这些与NeRF相关的方法由于体积渲染中低效的密集采样而难以感知3D结构信息。此外,它们缺乏场景表示向量中包含的细粒度语义信息,因为它们均匀地考虑自由空间和占据空间。这两者都会破坏下游RL任务的性能。为了解决上述挑战,我们首次提出了一种采用高效3D高斯泼溅(3DGS)来学习3D场景表示的新框架。简而言之,我们提出了基于查询的可泛化3DGS,以桥接3DGS技术和场景表示,比NeRF中的方法具有更强的几何感知能力。此外,我们提出了层次语义编码,将细粒度语义特征扎根于3D高斯,并进一步蒸馏到场景表示向量中。我们在两个RL平台(包括Maniskill2和Robomimic)上进行了大量实验,涵盖10个不同的任务。结果表明,我们的方法以较大优势优于其他5个基线。我们在8个任务上取得了最佳成功率,在另外两个任务上取得了第二好的成绩。
引用
@article{arxiv.2406.02370,
title = {Query-based Semantic Gaussian Field for Scene Representation in Reinforcement Learning},
author = {Jiaxu Wang and Ziyi Zhang and Qiang Zhang and Jia Li and Jingkai Sun and Mingyuan Sun and Junhao He and Renjing Xu},
journal= {arXiv preprint arXiv:2406.02370},
year = {2024}
}