中文

轨迹数据中的对称性检测以构建更具语义的强化学习表示

机器学习 2022-11-30 v1 人工智能 机器人学

摘要

对强化学习 (RL) 系统对称性的认知可用于创建低层状态空间的压缩且具语义的表示。我们提出了一种直接从原始轨迹数据自动检测 RL 对称性的方法,无需对系统进行主动控制。该方法生成候选对称性,并训练循环神经网络 (RNN) 来区分原始轨迹与每个候选对称性对应的变换后轨迹。RNN 判别器对每个候选的准确率揭示了系统在该变换下的对称程度。此信息可用于创建在数据集层面对所有对称性保持不变的高层表示,并向用户传达 RL 行为的特性。我们在两个模拟 RL 用例(推杆机器人和在风中飞行的 UAV)上的实验表明,我们的方法能够确定环境物理特性和训练所得 RL 策略背后的对称性。

关键词

引用

@article{arxiv.2211.16381,
  title  = {Symmetry Detection in Trajectory Data for More Meaningful Reinforcement Learning Representations},
  author = {Marissa D'Alonzo and Rebecca Russell},
  journal= {arXiv preprint arXiv:2211.16381},
  year   = {2022}
}

备注

Appears in Proceedings of AAAI FSS-22 Symposium "Lessons Learned for Autonomous Assessment of Machine Abilities (LLAAMA)"