R-AIF:利用主动推断与世界模型从像素中解决稀疏奖励机器人任务
机器人学
2024-09-24 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
尽管研究已经产生了有前景的结果,证明了主动推断 (AIF) 在马尔可夫决策过程 (MDPs) 中的效用,但在部分可观测马尔可夫决策过程 (POMDPs) 形式的环境和问题中构建 AIF 模型的工作相对较少。在 POMDP 场景中,智能体必须从原始感官观测(例如图像中的像素)推断未观测到的环境状态。此外,考察以 POMDP 为中心的最困难控制形式的工作更少:稀疏奖励信号下的连续动作空间 POMDPs。在这项工作中,我们通过引入新颖的先验偏好学习技术和自我修正调度,解决了 AIF 建模范式面临的问题,以帮助智能体在稀疏奖励、连续动作、基于目标的机器人控制 POMDP 环境中表现出色。根据经验,我们表明我们的智能体在累积奖励、相对稳定性和成功率方面优于 SOTA 模型。支持本工作的代码可在 https://github.com/NACLab/robust-active-inference 找到。
引用
@article{arxiv.2409.14216,
title = {R-AIF: Solving Sparse-Reward Robotic Tasks from Pixels with Active Inference and World Models},
author = {Viet Dung Nguyen and Zhizhuo Yang and Christopher L. Buckley and Alexander Ororbia},
journal= {arXiv preprint arXiv:2409.14216},
year = {2024}
}
备注
20 pages, 2 algorithms, 2 tables, 5 figures, submitted to ICRA 2025