中文

过度自信的预言机:计算机模拟序列设计基准测试的局限性

机器学习 2025-02-25 v1

摘要

机器学习方法能够自动化生物序列的计算机模拟(in silico)设计,旨在降低成本并加速医学研究。由于湿实验室资源有限,计算机模拟设计方法通常使用预言机(oracle)模型来评估从头生成的序列。然而,不同方法所使用的预言机模型各异,使得可靠地比较这些方法颇具挑战性,这引出了一个问题:计算机模拟序列设计基准测试可靠吗?在本研究中,我们考察了 12 种利用文献中常见机器学习预言机的序列设计方法,发现它们在交叉一致性和可重复性方面存在重大挑战。事实上,研究表明,架构不同甚至仅训练随机种子不同的预言机,会产生相互矛盾的相对性能表现,我们的分析指出分布外泛化能力差是关键问题。为应对这些挑战,我们建议在评估中补充一套生物物理指标,以评估生成序列的可行性,并限制预言机需要打分的分布外序列,从而提高设计流程的鲁棒性。本研究旨在揭示当前评估过程中的潜在陷阱,并助力开发稳健的基准测试,最终推动计算机模拟设计方法的改进。

关键词

引用

@article{arxiv.2502.17246,
  title  = {Overconfident Oracles: Limitations of In Silico Sequence Design Benchmarking},
  author = {Shikha Surana and Nathan Grinsztajn and Timothy Atkinson and Paul Duckworth and Thomas D. Barrett},
  journal= {arXiv preprint arXiv:2502.17246},
  year   = {2025}
}