中文

从策略设计:面向离线策略优化的保守测试时自适应

机器学习 2023-10-31 v2

摘要

在本工作中,我们将迭代的双层离线 RL(价值估计与策略提取)从离线训练阶段解耦,形成非迭代双层范式,并避免两层间的迭代误差传播。具体而言,该非迭代范式允许我们在训练中进行内层优化(价值估计),而在测试中进行外层优化(策略提取)。自然地,这种范式提出了三个核心问题,先前的非迭代离线 RL 方法(如奖励条件策略)未能充分回答:(q1)我们应从内层向外层传递什么信息?(q2)在利用所传递信息进行安全/可信外层优化时,我们应关注什么?(q3)在测试期间同时进行外层优化有何益处?受基于模型的优化(MBO)启发,我们提出 DROP(从策略设计),其充分回答了上述问题。具体而言,在内层,DROP 将离线数据分解为多个子集,并学习一个 MBO 分数模型(a1)。为在外层保持对该分数模型的安全利用,我们显式学习一个行为嵌入并引入保守正则化(a2)。在测试期间,我们表明 DROP 允许部署自适应,实现跨状态的自适应推理(a3)。在经验上,我们在多种任务上评估 DROP,显示其获得与先前方法相当或更好的性能。

关键词

引用

@article{arxiv.2306.14479,
  title  = {Design from Policies: Conservative Test-Time Adaptation for Offline Policy Optimization},
  author = {Jinxin Liu and Hongyin Zhang and Zifeng Zhuang and Yachen Kang and Donglin Wang and Bin Wang},
  journal= {arXiv preprint arXiv:2306.14479},
  year   = {2023}
}

备注

NeurIPS 2023