中文

Lever:在支持限制下的推理时策略复用

机器学习 2026-04-29 v2

摘要

强化学习(RL)策略通常针对固定目标进行训练,难以在任务需求变化时进行复用。我们研究推理时策略复用:给定一组预训练策略和一个新的组合目标,是否可以在无需额外环境交互的情况下完全离线构建出高质量策略?我们引入 lever(Leveraging Efficient Vector Embeddings for Reusable policies),一个端到端框架,通过行为嵌入检索相关策略、评估它们并通过离线 Q 值组合构建新策略。我们关注受支持限制的场景,即无法进行价值传播,表明复用的有效性严重取决于可用转换的覆盖范围。为平衡性能和计算成本,lever 提出了控制候选策略探索的组合策略。在确定性 GridWorld 环境中进行的实验表明,推理时组合可以匹配甚至在某些情况下超过从头训练的性能,同时提供了显著的加速。与此同时,当长期依赖需要价值传播时,性能会下降,这凸显了离线复用的根本局限。

关键词

引用

@article{arxiv.2604.20174,
  title  = {Lever: Inference-Time Policy Reuse under Support Constraints},
  author = {Ihor Vitenko and Noha Ibrahim and Sihem Amer-Yahia},
  journal= {arXiv preprint arXiv:2604.20174},
  year   = {2026}
}