中文

物理强化学习

机器学习 2025-11-25 v1 无序系统与神经网络

摘要

数字计算机耗能高且对损坏组件极其不耐受,可能难以用于能源受限且处于不确定环境中的自主智能体。最近发展出的对比式局部学习网络(Contrastive Local Learning Networks, CLLNs)——由自调节非线性电阻构成的模拟网络——本身低功耗且对物理损坏具备鲁棒性,但最初是用于执行监督式学习。本文演示了在两个简单强化学习问题中,使用针对模拟CLLNs适配的Q学习方法取得成功。通过这种方式,我们明确地揭示了(除正在训练的网络之外)实现强化学习工具箱中各种工具所必需的组件,其中一些工具(如策略函数和价值函数)在该系统中更为自然,而其他工具(如回放缓冲区)则相对不那么自然。我们讨论了诸如数字硬件所要求的物理安全性假设,而CLLNs可以豁免的假设,以及生物系统无法依赖的假设,并强调了在生物学中重要且可在CLLNs中训练的次要目标,而在数字计算机中则毫无意义。

关键词

引用

@article{arxiv.2511.17789,
  title  = {Physical Reinforcement Learning},
  author = {Sam Dillavou and Shruti Mishra},
  journal= {arXiv preprint arXiv:2511.17789},
  year   = {2025}
}

备注

9 pages 4 figures