面向嗅觉搜索 POMDP 的深度强化学习:一项定量基准测试
机器人学
2023-03-21 v2 生物物理
流体动力学
摘要
嗅觉搜索 POMDP(部分可观测马尔可夫决策过程)是一个序贯决策问题,旨在模拟昆虫在湍流中寻找气味源所面临的任务,其解可应用于嗅探机器人。由于精确解难以企及,挑战在于以合理的计算代价寻找尽可能好的近似解。我们针对基于深度强化学习的求解器与传统 POMDP 近似求解器进行了定量基准测试。我们表明深度强化学习是标准方法的一个有竞争力的替代方案,特别是在生成适用于机器人的轻量级策略方面。
引用
@article{arxiv.2302.00706,
title = {Deep reinforcement learning for the olfactory search POMDP: a quantitative benchmark},
author = {Aurore Loisy and Robin A. Heinonen},
journal= {arXiv preprint arXiv:2302.00706},
year = {2023}
}