中文

基于案例引导的药物发现顺序实验计划

机器学习 2026-01-22 v1 人工智能 计算工程、金融与科学

摘要

在药物发现中最优排列实验实验室是面临严重不确定性和资源约束的高风险规划问题。标准强化学习(RL)的主要障碍是缺乏明确的环境模拟器或转换数据(s, a, s');规划必须仅依赖历史结果的数据库。我们引入了隐式贝叶斯马尔可夫决策过程(IBMDP),这是一种针对此类仿真器-free 设置设计的基于模型的 RL 框架。IBMDP 通过形成类似历史结果的非参数信念分布来构建转换动力学的案例引导式隐式模型。该机制使 Bayesian 信念更新能够随证据积累而进行,并采用集成 MCTS 规划生成稳定的政策,在实现期望结果信息增益与资源效率之间进行平衡。我们通过全面实验验证了 IBMDP。在一个真实的中枢神经系统(CNS)药物发现任务中,IBMDP 比已建立的启发式方法减少了最高 92% 的资源消耗,同时保持决策置信度。为严格评估决策质量,我们还在可计算最优政策的合成环境中对 IBMDP 进行了基准测试。我们的框架在与使用相同相似性-based 模型的确定性值迭代替代方案相比,显著提高了与该最优政策的对齐度,显示示了我们集成规划器的优越性。IBMDP 为数据丰富但仿真器贫乏领域的顺序实验设计提供了实用解决方案。

关键词

引用

@article{arxiv.2601.14710,
  title  = {Case-Guided Sequential Assay Planning in Drug Discovery},
  author = {Tianchi Chen and Jan Bima and Sean L. Wu and Otto Ritter and Bingjia Yang and Xiang Yu},
  journal= {arXiv preprint arXiv:2601.14710},
  year   = {2026}
}