关于时序差信号的上链视角: 用于超马尔可夫动力学的学习
机器学习
2026-02-09 v1 人工智能
摘要
非马尔可夫动力学在现实环境中常见,由于长程依赖、部分可观测性和记忆效应. 作为强化学习 (RL) 中心支柱的 Bellman 方程在非马尔可夫情形下仅近似有效. 现有工作常关注实际算法设计,并对关键问题 — — 即哪些动力学确实可被 Bellman 框架捕获,以及如何激发新算法类的最优近似 — — 提供有限的理论处理. 本文我们提出一种新的拓扑视角来观察时序差 (TD) 基于 RL. 我们指出,TD 误差可被视为状态转换拓扑空间中的 1-上链,而马尔可夫动力学则被解释为拓扑可积性. 这种新视角使我们能够通过 Bellman-de Rham 投影获得 TD 误差关于可积分量和拓扑残差的 Hodge 分解. 我们进一步提出 HodgeFlow Policy Search (HFPS),通过拟合势网络来最小化非可积分投影残差,在 RL 中实现稳定性/灵敏性保证. 在数值评估中,HFPS 显示在非马尔可夫情形下显著改进了 RL 性能.
引用
@article{arxiv.2602.06939,
title = {Cochain Perspectives on Temporal-Difference Signals for Learning Beyond Markov Dynamics},
author = {Zuyuan Zhang and Sizhe Tang and Tian Lan},
journal= {arXiv preprint arXiv:2602.06939},
year = {2026}
}