中文

面向风险感知与多目标强化学习的蒙特卡洛树搜索算法

偏微分方程分析 2025-06-26 v6

摘要

在许多风险感知与多目标强化学习设定中,用户的效用来源于对策略的一次执行。在这些设定下,基于平均未来回报做决策并不合适。例如,在医疗场景中患者可能仅有一次治疗疾病的机会。仅使用期望未来回报——在强化学习中称为价值——做决策,无法考虑决策可能带来的潜在不利或有利结果范围。因此,我们应不同地使用期望未来回报的分布,通过同时考虑未来与已累积回报,来表示智能体在决策时所需的关键信息。本文提出两种新颖的蒙特卡洛树搜索算法。首先,我们提出一种可针对非线性效用函数计算策略的蒙特卡洛树搜索算法 (NLU-MCTS),通过优化单次策略执行可获得的多种可能回报的效用,从而在风险感知与多目标设定下得到良好策略。其次,我们提出一种分布化蒙特卡洛树搜索算法 (DMCTS),其扩展了 NLU-MCTS。DMCTS 计算回报效用的近似后验分布,并在规划中利用 Thompson 采样来计算风险感知与多目标设定下的策略。两种算法在期望回报效用的多目标强化学习中都优于现有最优方法。

关键词

引用

@article{arxiv.2211.13033,
  title  = {Estimates controlling a function by only its radial derivative and applications to stable solutions of elliptic equations},
  author = {Xavier Cabre},
  journal= {arXiv preprint arXiv:2211.13033},
  year   = {2025}
}

备注

To appear in Amer. J. Math. arXiv admin note: substantial text overlap with arXiv:2205.11352