纳米尺度下含热涨落的强化学习
统计力学
2023-12-18 v2 计算物理
摘要
强化学习提供了一种学习选择动作以实现特定目标的框架。然而,在纳米尺度下,热涨落会妨碍学习过程。我们使用马尔可夫决策过程的一般框架来分析这一 regime,该框架适用于从纳米导航到纳米机器驱动的广泛问题。我们表明,在纳米尺度下,虽然最优动作应带来与所施加力乘以长度尺度再除以温度的小比值成比例的改进,但学习到的改进更小,且与这一小比值的平方成比例。因此,比较学习改进与理论最优改进的学习效率降至零。尽管如此,这些局限可通过使用在较低温度下学习到的动作来规避。这些结果通过小粒子团簇形状控制的模拟加以说明。
引用
@article{arxiv.2311.17519,
title = {Reinforcement Learning with thermal fluctuations at the nano-scale},
author = {Francesco Boccardo and Olivier Pierre-Louis},
journal= {arXiv preprint arXiv:2311.17519},
year = {2023}
}