基于情境边臂策略的线性求解器精确自调优
机器学习
2026-04-01 v4 数值分析
数值分析
摘要
我们提出了一个用于自适应精度调谐的强化学习(RL)框架,可推广至通用算法。该框架被建模为情境边臂问题,并通过离散化状态空间的增量动作价估计来求解,从而选择线性求解器计算步骤的最优精度配置,在精度和计算效率之间进行权衡。为验证其有效性,我们将框架应用于求解线性方程组的迭代细化。在该应用中,方法会根据系统计算的特征动态选择精度,在保持可接受精度和收敛性的同时提高计算效率。具体而言,动作价估计器以离散化特征(如近似条件数和矩阵范数)为输入,输出估计的动作价值,从而由策略选择具体的动作(针对特定计算步骤的所选精度配置),通过-贪婪策略进行优化,以最大化综合精度和计算成本的多目标奖励。实证结果表明,方法能够有效进行精度选择,在保持与双精度基准相当的精度的同时降低计算成本。该框架对多样化的超样本数据具有良好泛化性,并为将RL精度选择应用于其他数值算法提供了见解,推动了科学计算中混合精度数值方法的发展。据我们了解,这是首个在未见数据集上进行RL精度自调优并进行验证的工作。
引用
@article{arxiv.2601.00728,
title = {Precision autotuning for linear solvers via contextual bandit-based RL},
author = {Erin Carson and Xinye Chen},
journal= {arXiv preprint arXiv:2601.00728},
year = {2026}
}