Laplacian键盘:超越线性张量
机器学习
2026-05-19 v2 人工智能
摘要
在科学领域中,拉普拉斯特征向量常作为简化复杂系统的基本基底,从信号处理到量子力学皆如此。在强化学习(RL)中,它们同样在状态空间上形成基底,使奖励函数能够通过投影到小型特征向量子集来近似。这种投影使得零样本控制成为可能,但也引入了根本性限制:所诱导的策略仅能表达为所选特征向量线性张量的范围内。我们引入Laplacian键盘(LK),一个层次化框架,超越这一线性张量。LK从这些特征向量中构建任务无关的行为库,形成一种保证包含任何奖励在线性张量范围内的最优策略的行为基底。一个元策略学习如何动态拼接这些行为,从而实现对原始线性约束之外策略的高效学习。我们对零样本近似误差建立了理论界限,实证结果表明,LK在零样本解之上实现了改进,同时相较于标准RL方法实现了更好的样本效率。
引用
@article{arxiv.2602.07730,
title = {The Laplacian Keyboard: Beyond the Linear Span},
author = {Siddarth Chandrasekar and Marlos C. Machado},
journal= {arXiv preprint arXiv:2602.07730},
year = {2026}
}
备注
31 pages, 17 figures