预训练蛋白质语言模型的各向同性性与几何
其他定量生物学
2025-10-14 v1
摘要
大规模预训练语言模型已彻底变革自然语言处理,其针对蛋白质序列——视为氨基酸字符字符串——的应用已推动蛋白质分析。然而,蛋白质的独特特性,如可变序列长度和缺乏词-句类比,使得对蛋白质语言模型(LM)的深入理解必不可少。我们使用平均成对余弦相似度和IsoScore方法来探讨蛋白质LM嵌入空间的各向同性性,发现如ProtBERT和ProtXLNet等模型高度各向异性,仅使用2-14维用于全局和局部表示。相比之下,融合序列和基因本体术语数据的多模态训练在ProteinBERT中提高了各向同性性,这表明多样化的生物学输入可提高表示效率。我们还发现,嵌入距离与基于对齐的相似性评分之间的关联较弱,特别是在低相似性方面。
引用
@article{arxiv.2510.10655,
title = {Isotropy and Geometry of Pretrained Protein LMs},
author = {Sheikh Azizul Hakim and Kowshic Roy and M Saifur Rahman},
journal= {arXiv preprint arXiv:2510.10655},
year = {2025}
}
备注
Published in the Proceedings of the ICML 2025 Workshop on Multi-modal Foun- dation Models and Large Language Models for Life Sciences, Vancouver, Canada. 2025