中文

从像素到因子:用于强化学习的可独立可控状态变量学习

机器学习 2025-10-06 v1 人工智能

摘要

利用 factored Markov决策过程的算法在样本效率上远超因果表示方法,而这些方法又假设已知因果表示——这一要求在智能体仅看到高维观察时会失效。相反,深度强化学习能够处理此类输入,但无法从因果结构中受益。我们通过 Action-Controllable Factorization (ACF),一种对比学习方法,来解决这一表示问题,该方法揭示可独立可控的潜在变量——即每种动作都可以单独影响的状态组件。ACF 利用稀疏性:动作通常只影响一部分变量,而其余变量则遵循环境的动力学演化,从而为对比学习提供有信息的数据。ACF 在三个已知因果结构的基准测试中直接从像素观察中恢复可控因子:Taxi、FourRooms 和 MiniGrid-DoorKey, consistently 超越基线解缝算法。

关键词

引用

@article{arxiv.2510.02484,
  title  = {From Pixels to Factors: Learning Independently Controllable State Variables for Reinforcement Learning},
  author = {Rafael Rodriguez-Sanchez and Cameron Allen and George Konidaris},
  journal= {arXiv preprint arXiv:2510.02484},
  year   = {2025}
}