用于生成多样化优化候选的可逆上置信界算法
机器学习
2022-01-03 v1
摘要
强化学习中的多臂老虎机问题的大多数算法旨在最大化期望奖励,因此可用于为多种应用(例如 AlphaGo)搜索具有最高奖励(函数值)的优化候选。然而,在药物发现等一些典型应用场景中,目标是搜索一组具有高奖励的多样化候选。为此,我们提出了一种可逆上置信界(rUCB)算法,并展示了其在针对固有无序蛋白(IDPs)的虚拟筛选中的应用。结果表明,rUCB 在大幅减少查询次数的同时实现了高准确率和低性能损失。rUCB 可能在多点优化和其他强化学习情形中具有潜在应用。
引用
@article{arxiv.2112.14893,
title = {Reversible Upper Confidence Bound Algorithm to Generate Diverse Optimized Candidates},
author = {Bin Chong and Yingguang Yang and Zi-Le Wang and Hang Xing and Zhirong Liu},
journal= {arXiv preprint arXiv:2112.14893},
year = {2022}
}
备注
10 pages, 10 figures