多步逆预测并非所需之全部
机器学习
2024-09-10 v2 系统与控制
系统与控制
摘要
在真实世界的控制环境中,观测空间往往具有不必要的高维性,并受时间相关噪声的影响。然而,系统可控的动力学通常远比原始观测的动力学简单。因此,学习一个编码器将观测空间映射到更简单的控制相关变量空间是理想的。在本工作中,我们考虑由 Efroni 等人 (2022) 首次提出的 Ex-BMDP 模型,该模型将控制问题形式化,其中观测可被分解为确定性演化的动作依赖潜状态与不依赖动作的时间相关噪声。Lamb 等人 (2022) 提出了“AC-State”方法,用于在此类问题中学习编码器,以从观测中提取完整的动作依赖潜状态表示。AC-State 是一种多步逆预测方法,即它使用路径中第一个和最后一个状态的编码来预测路径中的第一个动作。然而,我们发现了 AC-State 无法学习状态中智能体可控因子的正确潜表示的情况。因此,我们提出了一种新算法 ACDF,它将多步逆预测与潜前向模型相结合。对于一大类 Ex-BMDP 模型,ACDF 能够保证正确推断出动作依赖的潜状态编码器。我们通过数值仿真在表格型 Ex-BMDP 上展示了 ACDF 的有效性;并在使用基于神经网络的编码器的高维环境中进行了验证。代码可在 https://github.com/midi-lab/acdf 获取。
引用
@article{arxiv.2403.11940,
title = {Multistep Inverse Is Not All You Need},
author = {Alexander Levine and Peter Stone and Amy Zhang},
journal= {arXiv preprint arXiv:2403.11940},
year = {2024}
}
备注
RLC 2024