熵正则化基于点的值迭代
人工智能
2024-02-15 v1
摘要
用于部分可观察问题的基于模型的规划器必须同时处理规划期间的模型不确定性和目标推断期间的目标不确定性。然而,基于模型的规划器在这些不确定性下可能脆弱,因为它们依赖于精确模型并倾向于承诺单一最优行为。受无模型设置结果的启发,我们提出了一种用于部分可观察问题的熵正则化基于模型的规划器。熵正则化通过鼓励策略不必要地承诺单一行为来促进规划和目标推断的策略鲁棒性。我们在三个问题领域评估了熵正则化策略的鲁棒性和目标推断性能。我们的结果表明,熵正则化策略在建模误差下获得更高的期望回报,并在目标推断期间获得更高的准确性,从而优于非熵正则化基线。
引用
@article{arxiv.2402.09388,
title = {Entropy-regularized Point-based Value Iteration},
author = {Harrison Delecki and Marcell Vazquez-Chanlatte and Esen Yel and Kyle Wray and Tomer Arnon and Stefan Witwicki and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2402.09388},
year = {2024}
}