中文

基于 PPO 适配交错编码器,用于 BabyAI 中的语言引导强化学习

机器学习 2025-10-28 v1 人工智能 图像与视频处理

摘要

深度强化学习智能体在需要同时理解视觉与语言的任务中常常表现不佳。传统架构通常将感知(例如基于 CNN 的视觉编码器)与决策(策略网络)隔离,这种分离可能效率不高,因为策略的错误并不直接帮助感知模块学习哪些特征重要。为此,我们实现了 Mao 等人(2023)提出的感知-决策交错变换器(PDiT)架构,该架构在单个变换器内部在感知层和决策层之间交替工作。这种交错设计允许决策过程的反馈动态地细化感知特征。此外,我们还整合了一个受 CLIP 启发的对比损失,用于将文本使命嵌入与视觉场景特征对齐。在 BabyAI GoToLocal 环境中对 PDiT 编码器进行评估,结果表明该方法在奖励稳定性和对齐方面优于标准 PPO 基准。结果表明,交错变换器编码器是开发更集成式自主智能体的有前景的方向。

关键词

引用

@article{arxiv.2510.23148,
  title  = {Adapting Interleaved Encoders with PPO for Language-Guided Reinforcement Learning in BabyAI},
  author = {Aryan Mathur and Asaduddin Ahmed},
  journal= {arXiv preprint arXiv:2510.23148},
  year   = {2025}
}

备注

Undergraduate research project, IIT Palakkad, 2025