学习何时行动:基于预测时序结构的区间感知强化学习
机器学习
2026-03-27 v2 人工智能
摘要
在连续环境中运行的自主智能体必须决定不仅要做什么,更要何时行动。我们引入一种轻量级自适应时序控制系统,从经验中学习最优行为间隔,取代仿生计时器,用原则性学习策略取代。策略状态被增强为来自双曲几何的预测双曲展开信号(“曲率信号”缩写),即来自在Poincare球中嵌入的n个采样未来之间的平均双Poincare距离。高展开度指示分支、不确定的未来,驱动智能体更快行动;低展开度指示可预测性,允许更长的休息间隔。我们进一步提出了区间感知奖励,显式惩罚相对于所选等待时间的效率不足,纠正了基于结果的奖励在时序问题中的系统性信用分配失效。我们 additionally 引入了联合时空嵌入(ATCPG-ST),将独立归一化的状态和位置投影在Poincare球中拼接;空间轨迹发散提供了不可用于仅限状态的变体(ATCPG-SO)的独立时序信号。该扩展将平均双曲展开度(kappa)从1.88提高到3.37,并在状态唯一基线上实现额外的5.8%效率提升。跨五个随机种子的消融实验表明:(i) 学习是主要效率因素(54.8%),(ii) 双曲展开度提供显著的补充收益(26.2%),(iii) 组合系统相对于固定间隔基线实现22.8%的效率提升,(iv) 将空间位置信息添加到展开嵌入中可实现额外的5.8%。
引用
@article{arxiv.2603.22384,
title = {Learning When to Act: Interval-Aware Reinforcement Learning with Predictive Temporal Structure},
author = {Davide Di Gioia},
journal= {arXiv preprint arXiv:2603.22384},
year = {2026}
}