中文

SAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous Control

机器学习 2026-05-04 v1

摘要

虽然表示学习和相似性学习已显著提高强化学习(RL)的样本效率,但它们很少被用于直接在动作空间中塑造策略更新。为弥合这一差距,我们提出一种基于值相关性的几何感知RL算法,即State-Action Value Geometry Optimization(SAVGO)。具体而言,SAVGO学习联合state-action嵌入空间,使得具有相似动作-值估计的对在余弦相似性下表现高,而差异较大的对则映射到不同的方向。这种学习的几何结构使我们能够在每个更新中生成candidate动作的相似性核,允许策略改进直接导向高价值区域,而不仅仅是局部基于梯度的更新。因此,表示学习、值估计和策略优化在一个单一的几何一致目标内统一,而保持离线actor-critic训练的可扩展性。我们在标准MuJoCo连续控制基准中评估了所提出的方法,证明其在具有挑战性的高维任务上优于强基线。进行了消融实验以分析值几何学习和基于相似性的策略更新各自的贡献。

关键词

引用

@article{arxiv.2605.00787,
  title  = {SAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous Control},
  author = {Stavros Orfanoudakis and Pedro P. Vergara},
  journal= {arXiv preprint arXiv:2605.00787},
  year   = {2026}
}

备注

Reinforcement Learning