面向 amortized sampler 的自适应教师
机器学习
2025-04-15 v2 机器学习
摘要
Amortized推断是训练参数化模型(如神经网络)以近似给定未归一化密度分布的任务,其中exact采样难以实现。当采样被实现为顺序决策过程时,可使用强化学习(RL)方法(如生成流网络)来训练采样策略。离屏策略RL训练有助于发现多样化的高奖励候选,但现有方法仍面临高效探索的挑战。我们提出使用自适应训练分布(教师)来指导主要amortized采样器(学生)的训练。教师是一种辅助行为模型,训练用于采样学生的高损失区域,并可跨越未探索的模式进行泛化,从而通过提供高效训练课程来增强模式覆盖。我们在设计用于呈现探索挑战的合成环境中验证了此方法的有效性,以及两种扩散基于采样任务和四个生物化学发现任务,证明其提高样本效率和模式覆盖的能力。源代码可在 https://github.com/alstn12088/adaptive-teacher 查看。
关键词
引用
@article{arxiv.2410.01432,
title = {Adaptive teachers for amortized samplers},
author = {Minsu Kim and Sanghyeok Choi and Taeyoung Yun and Emmanuel Bengio and Leo Feng and Jarrid Rector-Brooks and Sungsoo Ahn and Jinkyoo Park and Nikolay Malkin and Yoshua Bengio},
journal= {arXiv preprint arXiv:2410.01432},
year = {2025}
}
备注
ICLR 2025, 27 pages, 12 figures