基于强化学习的贝叶斯最优实验设计序贯批采样
机器学习
2021-12-24 v2 机器学习
摘要
由复杂数学方法建模或以为昂贵测试与实验为特征工程问题,受限于有限预算或有限计算资源。此外,工业中的实际场景基于物流与偏好对实验实施方式施加限制。例如,材料供应可能仅支持单次少量实验,或对于计算模型可能因共享计算资源而面临显著等待时间。在此类场景中,人们通常以使自身知识状态最大化同时满足上述实际约束的方式开展实验。序贯实验设计(SDOE)是一套流行的方法,近年来在不同工程与实际问题中取得了有前景的结果。一种利用贝叶斯形式主义的常见策略是贝叶斯 SDOE,它通常在一阶向前或短视场景下表现最佳,即在实验序列的每步仅选择一个实验。本工作中,我们旨在扩展 SDOE 策略,以在一批输入上查询实验或计算机代码。为此,我们利用基于深度强化学习(RL)的策略梯度方法,提出考虑到手头整体预算而选择的查询批。该算法保留了 SDOE 固有的序贯性质,同时融入来自深度 RL 领域的基于任务的奖励要素。所提方法的一个独特能力是其在训练后可应用于多任务,例如函数优化。我们在合成问题和一个具有挑战性的高维工程问题上展示了所提算法的性能。
引用
@article{arxiv.2112.10944,
title = {Reinforcement Learning based Sequential Batch-sampling for Bayesian Optimal Experimental Design},
author = {Yonatan Ashenafi and Piyush Pandita and Sayan Ghosh},
journal= {arXiv preprint arXiv:2112.10944},
year = {2021}
}