中文

PEARL:基于演员-评论家强化学习的预条件器增强

机器学习 2025-03-04 v2 数值分析 数值分析 机器学习

摘要

我们提出了 PEARL(Preconditioner Enhancement through Actor-critic Reinforcement Learning),一种新的矩阵预条件器学习方法。现有的预条件器,如 Jacobi、Incomplete LU 和代数多网格方法各有优势,但依赖于大量的超参数调优。近期的研究探索了使用深度神经网络学习预条件器,但仍面临目标函数异常和昂贵训练程序等挑战。PEARL 引入了基于强化学习的方法来学习预条件器,具体为情境型多臂老虎机问题。该框架利用演员-评论家模型,其中演员生成预条件器的 incomplete Cholesky 分解,评论家根据特定奖励反馈对其进行评估。为进一步引导训练,我们设计了双目标函数,结合评论家更新和条件数。PEARL 贡献了一种通用可学习的预条件器方法、动态稀疏性探索以及余弦调度器,以提高稳定性和探索能力。我们将方法与传统和神经预条件器进行比较,显示出更好的灵活性和迭代求解速度。

关键词

引用

@article{arxiv.2501.10750,
  title  = {PEARL: Preconditioner Enhancement through Actor-critic Reinforcement Learning},
  author = {David Millard and Arielle Carr and Stéphane Gaudreault and Ali Baheri},
  journal= {arXiv preprint arXiv:2501.10750},
  year   = {2025}
}