中文

多状态-动作分词:用于多离散动作空间的决策转换器

机器学习 2024-07-02 v1 计算机视觉与模式识别

摘要

决策转换器在其基础形式下在基于图像的环境中处理多离散动作空间时表现不佳。尽管已开发了增强型决策转换器架构以提高性能,但这些方法并未特别解决多离散动作空间的问题,这些问题阻碍了决策转换器架构学习良好表征。为缓解这一问题,我们提出了多状态-动作分词 (M-SAT),一种用于多离散动作空间动作分词的方法,可提高此类环境中模型的性能。我们的方法涉及两个关键更改:将动作解耦到单个动作级别并使用辅助状态信息对动作进行分词。这两个关键更改还提高了单个动作级别的可解释性和可见性。我们在具有多离散动作空间和基于图像的状态空间的具有挑战性的 ViZDoom 环境中展示了 M-SAT 的性能提升,包括致命走廊和我的之路家园场景,其中 M-SAT 在没有额外数据或重型计算开销的情况下超过了基线决策转换器。此外,我们发现去除位置编码并不会 adversely M-SAT 的性能,甚至在某些情况下会提高其性能。

关键词

引用

@article{arxiv.2407.01310,
  title  = {Multi-State-Action Tokenisation in Decision Transformers for Multi-Discrete Action Spaces},
  author = {Perusha Moodley and Pramod Kaushik and Dhillu Thambi and Mark Trovinger and Praveen Paruchuri and Xia Hong and Benjamin Rosman},
  journal= {arXiv preprint arXiv:2407.01310},
  year   = {2024}
}