中文

大语言模型在生物分子建模中的局限性:一项跨尺度评估

机器学习 2026-04-07 v1 定量方法

摘要

跨分子尺度的生物分子系统建模仍然是科学研究中的核心挑战。大语言模型日益应用于生物分子发现,然而,针对多尺度生物问题的系统性评估以及对其工具增强能力的严格评价仍然有限。我们通过提出的跨尺度生物分子基准BioMol-LLM-Bench,揭示了大语言模型性能与机制理解之间的系统性差距。该基准是一个统一框架,包含26个下游任务,涵盖4个不同的难度级别,并集成了计算工具以实现更全面的评估。对13个代表性模型的评估揭示了4个主要发现:思维链数据带来的益处有限,甚至可能降低在生物任务上的表现;混合mamba-attention架构对于长生物分子序列更有效;监督微调以牺牲泛化能力为代价提高了专业化程度;当前的大语言模型在分类任务上表现良好,但在具有挑战性的回归任务上仍然薄弱。这些发现共同为未来基于大语言模型的分子系统建模提供了实践指导。

关键词

引用

@article{arxiv.2604.03361,
  title  = {The limits of bio-molecular modeling with large language models : a cross-scale evaluation},
  author = {Yaxin Xu and Yue Zhou and Tianyu Zhao and Fengwei An and Zhixiang Ren},
  journal= {arXiv preprint arXiv:2604.03361},
  year   = {2026}
}