中文

基于策略引导梯度搜索的离线模型优化

机器学习 2024-05-10 v1 人工智能

摘要

离线优化是许多实验工程领域(包括蛋白质、药物或飞机设计)中的一个新兴问题,在这些领域中,收集评估数据的在线实验过于昂贵或危险。为了避免这一点,人们必须在仅给定固定输入集上的离线评估的情况下优化未知函数。解决该问题的一种朴素方法是学习未知函数的代理模型并转而优化该代理模型。然而,这种朴素的优化器在离线数据集之外的输入上容易对代理模型产生错误的过高估计(可能是由于在有偏的函数评估样本上过拟合)。先前解决这一挑战的方法主要集中在学习鲁棒的代理模型上。然而,它们的搜索策略是源自代理模型而非实际的离线数据。为了填补这一重要空白,我们通过将离线优化重新表述为离线强化学习问题,引入了一种新的学习搜索视角。我们提出的策略引导梯度搜索方法明确地为从离线数据创建的给定代理模型学习最佳策略。我们在多个基准上的实证结果表明,学习到的优化策略可以与现有的离线代理相结合,以显著提高优化性能。

关键词

引用

@article{arxiv.2405.05349,
  title  = {Offline Model-Based Optimization via Policy-Guided Gradient Search},
  author = {Yassine Chemingui and Aryan Deshwal and Trong Nghia Hoang and Janardhan Rao Doppa},
  journal= {arXiv preprint arXiv:2405.05349},
  year   = {2024}
}

备注

Published at AAAI Conference on Artificial Intelligence, 2024