基于线性标量化的多目标线性二次型调节器
最优化与控制
2025-01-16 v2
摘要
决策框架通常被建模为马尔可夫决策过程(MDP),并假设只有一个单一目标。然而,实际场景中往往涉及多个目标之间的权衡。我们在线性二次型调节器(LQR)这一典型的连续时间、无限时域MDP中解决此问题。首先,我们确立了LQR的帕累托前沿由线性标量化所表征:目标的凸组合能够恢复所有权衡点,这使得多目标LQR可简化为单目标问题。这突显了一个重要实例,即线性标量化足以解决一个非凸问题。其次,我们证明了帕累托前沿是平滑的,即对标量化参数的一个扰动会产生对目标的一个近似。这些结果启发了一个简单的算法,通过对标量化参数进行网格搜索来近似帕累托前沿,其中每个优化问题都保留了单目标LQR的计算效率。最后,我们将分析扩展到确定性等价情况,即用估计值替代未知的动态特性。
引用
@article{arxiv.2408.04488,
title = {Multi-Objective LQR with Linear Scalarization},
author = {Ali Jadbabaie and Devavrat Shah and Sean R. Sinclair},
journal= {arXiv preprint arXiv:2408.04488},
year = {2025}
}
备注
38 pages, 2 figures