FlickerFusion:基于内轨迹的多智能体强化学习
机器人学
2025-05-21 v2
摘要
多智能体强化学习已在解决各种实际应用中的复杂合作任务方面展现出巨大潜力。然而,现有的MARL方法往往依赖于实体数量(如智能体、障碍物)在训练和推理期间保持恒定的限制性假设。这忽略了实体在推理轨迹中动态添加或删除的情形——这在搜索和救援任务和动态作战情境等实际环境中很常见。在本文中,我们针对在零样本外域(OOD)推理下的轨迹内动态实体组成挑战进行了方法设计。我们的实证研究揭示,现有MARL方法在这些情境下会出现显著性能下降和不确定性增加。作为响应,我们提出了FlickerFusion,这是一种 novel OOD泛化方法,可作为通用可用的MARL骨干方法的增强技术。FlickerFusion随机丢弃部分观测空间,模拟在推理时处于内域状态。结果表明,FlickerFusion不仅实现了优异的推理奖励,还独特地相对于骨干方法降低了不确定性。基准、实现和模型权重已组织并开源于https://flickerfusion305.github.io,配有丰富的演示视频渲染。
引用
@article{arxiv.2410.15879,
title = {Triplane Grasping: Efficient 6-DoF Grasping with Single RGB Images},
author = {Yiming Li and Hanchi Ren and Yue Yang and Jingjing Deng and Xianghua Xie},
journal= {arXiv preprint arXiv:2410.15879},
year = {2025}
}