中文

生物序列的跨粒度表示:来自 ESM 和 BiGCARP 的洞见

机器学习 2026-03-24 v1

摘要

近期通用基础模型的进展推动了大型生物序列模型的发展。虽然自然语言显示符号粒度(字符、词、句子),但生物序列具有层次性粒度,其不同层级(核苷酸、氨基酸、蛋白质域、基因)进一步编码生物功能信息。本文通过 BiGCARP(生物合成基因簇的 Pfam 域级模型)和 ESM(氨基酸级蛋白语言模型)的案例研究,探讨了如何通过模型整合跨粒度知识。使用表示分析工具和一组探针任务,我们首先解释了为何直接的跨模型嵌入初始化无法提升 BiGCARP 的下游性能,并展示了更深层的嵌入捕获了模型所学习知识的更具上下文和忠实的表征。进一步地,我们证明了不同粒度的表征编码了互补的生物知识,组合后可在中等水平预测任务中实现可衡量的性能提升。我们的发现表明,跨粒度整合是提高生物基础模型性能和可解释性的有前景的策略。

关键词

引用

@article{arxiv.2603.20825,
  title  = {Cross-Granularity Representations for Biological Sequences: Insights from ESM and BiGCARP},
  author = {Hanlin Xiao and Rainer Breitling and Eriko Takano and Mauricio A. Álvarez},
  journal= {arXiv preprint arXiv:2603.20825},
  year   = {2026}
}

备注

9 pages, 4 figures, published in 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)