中文

基于物理信息符号程序先验的强化学习用于零样本室内导航

机器学习 2025-06-30 v1 机器人学

摘要

在使用强化学习 (RL) 解决物理控制任务时,编码物理先验的归纳偏置有助于提高训练期间的样本效率,并增强测试时的泛化能力。然而,当前采用这些有益物理信息归纳偏置的做法不可避免地面临显著的手动工作和领域专业知识要求,使得其对普通用户而言不可行。本工作探索了将物理信息归纳偏置提炼到 RL 代理中的符号方法,其中物理先验以人类可读且自然可解释的领域特定语言 (DSL) 形式表达。然而,DSL 先验由于观测部分且嘈杂,以及导航任务中的额外物理约束,难以直接转化为可实现的策略。为解决这一差距,我们开发了面向室内导航的物理信息程序引导强化学习 (PiPRL) 框架。PiPRL 采用层次化和模块化的神经符号集成方式,元符号程序从神经感知模块接收语义有意义的特征,这些特征构成符号编程的基础,编码物理先验并指导底层神经控制器的 RL 过程。广泛实验表明,PiPRL 在获得程序化归纳偏置帮助下,始终优于纯符号或神经策略,并将训练时间缩短超过 26%。

关键词

引用

@article{arxiv.2506.22365,
  title  = {Reinforcement Learning with Physics-Informed Symbolic Program Priors for Zero-Shot Wireless Indoor Navigation},
  author = {Tao Li and Haozhe Lei and Mingsheng Yin and Yaqi Hu},
  journal= {arXiv preprint arXiv:2506.22365},
  year   = {2025}
}

备注

Spotlight paper at Reinforcement Learning Conference 2025, Workshop on Inductive Biases in Reinforcement Learning