中文

基于线性标量化的多目标线性二次型调节器

最优化与控制 2025-01-16 v2

摘要

决策框架通常被建模为马尔可夫决策过程(MDP),并假设只有一个单一目标。然而,实际场景中往往涉及多个目标之间的权衡。我们在线性二次型调节器(LQR)这一典型的连续时间、无限时域MDP中解决此问题。首先,我们确立了LQR的帕累托前沿由线性标量化所表征:目标的凸组合能够恢复所有权衡点,这使得多目标LQR可简化为单目标问题。这突显了一个重要实例,即线性标量化足以解决一个非凸问题。其次,我们证明了帕累托前沿是平滑的,即对标量化参数的一个ϵ\epsilon扰动会产生对目标的一个ϵ\epsilon近似。这些结果启发了一个简单的算法,通过对标量化参数进行网格搜索来近似帕累托前沿,其中每个优化问题都保留了单目标LQR的计算效率。最后,我们将分析扩展到确定性等价情况,即用估计值替代未知的动态特性。

关键词

引用

@article{arxiv.2408.04488,
  title  = {Multi-Objective LQR with Linear Scalarization},
  author = {Ali Jadbabaie and Devavrat Shah and Sean R. Sinclair},
  journal= {arXiv preprint arXiv:2408.04488},
  year   = {2025}
}

备注

38 pages, 2 figures