中文

摩擦Q学习

机器学习 2026-05-12 v5 人工智能

摘要

离线强化学习在学习策略选择回放缓冲区中支持较弱的动作时,会遭受外推误差。本研究通过类比静摩擦来解决这一问题。从这一视角来看,回放缓冲区被表示为一个平滑的低维动作流形,其中支持方向对应于切向分量,而法向分量捕获主导的一阶外推误差。这种分解揭示了价值敏感性的内在各向异性,自然地诱导出类似于摩擦阈值的稳定性条件。为了减轻向不支持动作的偏离,我们提出了摩擦Q学习,一种离线策略算法,利用对比变分自编码器将支持动作编码为切向方向。我们进一步证明,在 mild local isometry 假设下,正交补的正交基对应于法向分量。在标准连续控制基准上的广泛实证结果一致地展示了与竞争基线相比的鲁棒且稳定的性能。

关键词

引用

@article{arxiv.2509.19771,
  title  = {Frictional Q-Learning},
  author = {Hyunwoo Kim and Hyo Kyung Lee},
  journal= {arXiv preprint arXiv:2509.19771},
  year   = {2026}
}