中文

生物序列设计中改进的无策略强化学习方法

机器学习 2025-06-18 v2 生物大分子

摘要

设计具有所需属性的生物序列面临着巨大的搜索空间和有限的评估预算的挑战。尽管强化学习方法使用代理模型进行快速奖励评估,但不足的训练数据可能导致代理模型在分布外输入上出现误指定。为此,我们提出了一种新的无策略搜索方法,即δ\delta-保守搜索,通过限制策略在可靠区域的探索来增强鲁棒性。我们从高得分的离线序列开始,通过随机以概率δ\delta屏蔽标记来注入噪声,然后使用我们的策略对其进行去噪。我们进一步根据每个数据点的代理不确定性调整δ\delta,将保守程度与模型置信水平相匹配。实验结果表明,我们的保守搜索在无策略训练中持续显著提升性能,在包括DNA、RNA、蛋白质和肽设计在内的多种任务中,均优于现有的机器学习方法,能够发现更高的得分序列。

关键词

引用

@article{arxiv.2410.04461,
  title  = {Improved Off-policy Reinforcement Learning in Biological Sequence Design},
  author = {Hyeonah Kim and Minsu Kim and Taeyoung Yun and Sanghyeok Choi and Emmanuel Bengio and Alex Hernández-García and Jinkyoo Park},
  journal= {arXiv preprint arXiv:2410.04461},
  year   = {2025}
}

备注

ICML 2025