中文

统一策略-价值分解用于快速适应

机器学习 2026-03-19 v1 神经元与认知

摘要

复杂控制系统中的快速适应仍然是强化学习中的核心挑战。我们引入了一个框架,其中策略和价值函数共享一个低维系数向量——目标嵌入——该向量捕获任务身份并能在不重新训练表示的情况下实现对新任务的即时适应。在预训练期间,我们通过双线性演员-评论家分解联合学习结构化价值基和兼容策略基。评论家分解为 Q = Σ_k G_k(g) y_k(s,a),其中 G_k(g) 是目标条件系数向量,y_k(s,a) 是学习到的价值基函数。这种乘法门控——其中上下文信号缩放一组状态依赖的基——让人联想到第 5 层锥体神经元中观察到的增益调制,其中自上而下的输入调节感官驱动响应的增益而不改变其调谐特性。基于后继特征,我们将分解扩展到演员,演员由相同的系数 G_k(g) 加权组合一组原始策略。在测试时,基函数被冻结,G_k(g) 通过单次前向传播零样本估计,实现对新任务的即时适应而无需任何梯度更新。我们在 MuJoCo Ant 环境上训练了一个 Soft Actor-Critic 智能体,在多方向运动目标下,要求智能体沿八个由连续目标向量指定的方向行走。双线性结构使每个策略头可以专门化于方向子集,而共享系数层在其间泛化,通过在目标嵌入空间中插值来适应新方向。我们的结果表明,共享的低维目标嵌入为高层控制中的快速结构化适应提供了一种通用机制,并揭示了复杂强化学习系统中高效迁移的一个潜在生物学合理原则。

关键词

引用

@article{arxiv.2603.17947,
  title  = {Unified Policy Value Decomposition for Rapid Adaptation},
  author = {Cristiano Capone and Luca Falorsi and Andrea Ciardiello and Luca Manneschi},
  journal= {arXiv preprint arXiv:2603.17947},
  year   = {2026}
}