域即目标: 通过显式多域凸覆盖集学习实现域不确定性感知策略优化
机器人学
2024-10-08 v1
摘要
不确定性问题是真实世界机器人问题的一个特征,任何控制框架都必须应对它才能在真实应用任务中成功。强化学习也不例外,由模型不确定性或错误设定引起的认知不确定性是模拟到现实差距所很好捕捉的挑战。这个问题的一个简单解决方案是域随机化(DR),但它不幸地可能导致保守的智能体。作为对这种保守性的补救措施,使用利用关于随机化域的额外信息的通用策略,以及基于循环神经网络的控制器,已成为替代解决方案。不确定性感知的通用策略提供了一种特别有说服力的解决方案,能够在部署期间考虑系统辨识的不确定性。在本文中,我们揭示了高效优化不确定性感知策略的挑战可以从根本上被重新定义为在多目标强化学习(MORL)背景下求解凸覆盖集(CCS)问题。通过引入一个新颖的马尔可夫决策过程(MDP)框架,其中每个域的性能被视为一个独立的目标,我们将不确定性感知策略的训练与MORL方法统一起来。这种联系使得MORL算法能够应用于域随机化(DR),从而实现更高效的策略优化。为了说明这一点,我们专注于线性效用函数,它与DR公式中的期望一致,并提出了一系列从MORL文献中改编的算法来求解CCS,展示了它们增强不确定性感知策略性能的能力。
引用
@article{arxiv.2410.04719,
title = {Domains as Objectives: Domain-Uncertainty-Aware Policy Optimization through Explicit Multi-Domain Convex Coverage Set Learning},
author = {Wendyam Eric Lionel Ilboudo and Taisuke Kobayashi and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2410.04719},
year = {2024}
}
备注
27 pages, 9 figures, 12 tables, under review by IJRR