TAB-Fields:面向任务导向的对抗性规划最大熵框架
机器人学
2024-12-04 v1 人工智能
机器学习
多智能体系统
系统与控制
系统与控制
摘要
在对抗场景中运行的自主代理面临一个根本性挑战:尽管它们可能知道对手的高层目标(例如到达特定目的地),但这些对手将采取的确切策略仍是未知的。传统方法通过将对手的状态视为部分可观测元素来解决这一挑战,将其建模为部分可观测马尔可夫决策过程(POMDP)。然而,POMDP中引发的信念空间动力学需要对系统的转移动力学进行了解,而这些动力学取决于对手未知的策略。我们的关键观察是,尽管对手的确切策略未知,但他们的行为必然受制于其使命目标和物理环境的约束,这使我们能够在不假设具体策略的前提下描述可能的行为空间。在本文中,我们开发了任务感知行为场(Task-Aware Behavior Fields, TAB-Fields),这是一种捕获对手随时间状态分布的表示方法,通过计算最无偏的与已知约束一致的概率分布来实现。我们通过解决一个最小化对对手行为在任务和环境要求之外的额外假设的约束优化问题来构建TAB-Fields。我们将TAB-Fields与标准规划算法集成,通过引入TAB-条件POMCP(TAB-conditioned POMCP)来实现对部分可观测蒙特卡洛规划的改造。通过水下机器人仿真实验和地面机器人硬件实现,我们展示了我们的做法在各种基准方法上均取得优异性能,这些方法要么假设特定的对手策略,要么忽略任务约束。评估视频和代码可在https://tab-fields.github.io获取。
引用
@article{arxiv.2412.02570,
title = {TAB-Fields: A Maximum Entropy Framework for Mission-Aware Adversarial Planning},
author = {Gokul Puthumanaillam and Jae Hyuk Song and Nurzhan Yesmagambet and Shinkyu Park and Melkior Ornik},
journal= {arXiv preprint arXiv:2412.02570},
year = {2024}
}