学习观察:通过策略分解为决策寻求信息
机器人学
2024-10-25 v1 机器学习
摘要
许多机器人操作任务需要主动或交互式的探索行为才能成功执行。这类任务在具身领域普遍存在,智能体必须主动搜索任务每个阶段所需的信息,例如,移动机器人头部以寻找与操作相关的信息;或者在多机器人领域中,一个侦察机器人可能搜索另一个机器人做出明智决策所需的信息。我们将这些任务识别为一类新问题——分解的上下文马尔可夫决策过程,并提出了DISaM,一种由双策略组成的解决方案:一个信息寻求策略,用于探索环境以找到相关的上下文信息;以及一个信息接收策略,用于利用上下文来实现操作目标。这种分解允许我们分别训练两个策略,利用信息接收策略提供奖励来训练信息寻求策略。在测试时,双智能体基于操作策略对下一步最佳行动的不确定性来平衡探索与利用。我们在五个需要信息寻求行为的操作任务中展示了双策略解决方案的能力,无论是在仿真中还是在真实世界中,DISaM都显著优于现有方法。更多信息请访问 https://robin-lab.cs.utexas.edu/learning2look/。
引用
@article{arxiv.2410.18964,
title = {Learning to Look: Seeking Information for Decision Making via Policy Factorization},
author = {Shivin Dass and Jiaheng Hu and Ben Abbatematteo and Peter Stone and Roberto Martín-Martín},
journal= {arXiv preprint arXiv:2410.18964},
year = {2024}
}
备注
Project Website: https://robin-lab.cs.utexas.edu/learning2look/