中文

面向稳健风格对齐的离线强化学习高质量行为学习

机器学习 2026-02-02 v1 人工智能 机器人学

摘要

我们研究了使用通过子轨迹标注函数实现的显式风格监督的风格条件策略的离线强化学习。在此设置下,由于分布迁移和风格与奖励内在冲突,风格与高任务性能的对齐尤其具有挑战性。现有方法尽管提出了诸多风格定义,往往难以有效协调这些目标。为应对这些挑战,我们提出了一种统一的行为风格定义,并将其具体化为一个实用框架。基于此,我们引入了风格条件隐式 Q 学习(SCIQL),它利用离线目标条件强化学习技术,如 hindsight 重标和价值学习,并结合一种新的 Gated Advantage Weighted Regression 机制,以有效优化任务性能,同时保持风格对齐。实验表明,SCIQL 在两个目标上均优于先前离线方法。代码、数据集和可视化材料已在 https://sciql-iclr-2026.github.io/ 上提供。

关键词

引用

@article{arxiv.2601.22823,
  title  = {Offline Reinforcement Learning of High-Quality Behaviors Under Robust Style Alignment},
  author = {Mathieu Petitbois and Rémy Portelas and Sylvain Lamprier},
  journal= {arXiv preprint arXiv:2601.22823},
  year   = {2026}
}