中文

面向离散性变化情境的上下文 RL 动力学对齐共享超网络

机器学习 2026-05-12 v2 人工智能

摘要

在情境强化学习中,零样本泛化仍是核心挑战,尤其当情境是潜在的且必须从数据中推断时。一个典型的失败模式是:当潜在情境离散性地改变动作对环境的影响时,需要跨情境之间不兼容的控制响应。我们提出 DMA*-SH(Dynamics-Aligned Shared Hypernetworks for contextual RL under Discontinuous Shifts),一个框架,其中单个超网络仅通过动力学预测进行训练,生成一小组在动力学模型、策略和动作价值函数之间共享的适配器权重。这种共享调制赋予与离散情境-动力学变化相匹配的归纳偏置,而输入/输出归一化和随机输入掩码稳定情境推断,促进方向性集中表示。我们通过超网络调制的表达性分离结果和方差分解(伴随策略梯度方差上界)提供了理论支持,形式化了在非重叠情境下通过单模压缩如何改进学习。为评估,我们引入了执行器反转基准(Actuator Inversion Benchmark,AIB),一套旨在隔离具有挑战性情境-动力学互动的环境,包括执行器反转、执行器置换以及弱非重叠连续动力学。在 AIB 的 held-out 任务上,DMA*-SH 实现了零样本泛化,相较于域随机化提升了 58.1%,超越标准情境感知基线提升了 11.5%。

关键词

引用

@article{arxiv.2602.06550,
  title  = {Dynamics-Aligned Shared Hypernetworks for Contextual RL under Discontinuous Shifts},
  author = {Jan Benad and Pradeep Kr. Banerjee and Frank Röder and Nihat Ay and Martin V. Butz and Manfred Eppe},
  journal= {arXiv preprint arXiv:2602.06550},
  year   = {2026}
}