BioLangFusion:DNA、mRNA和蛋白质语言模型的多模态融合
机器学习
2025-06-11 v1
摘要
我们提出了BioLangFusion,一种将预训练的DNA、mRNA和蛋白质语言模型整合为统一分子表示的简单方法。受分子生物学中心法则(从基因到转录本再到蛋白质的信息流)的启发,我们在生物学上有意义的密码子水平(三个核苷酸编码一个氨基酸)对各模态嵌入进行对齐,以确保直接的跨模态对应关系。BioLangFusion研究了三种标准融合技术:(i)密码子水平嵌入拼接,(ii)受多实例学习启发的熵正则化注意力池化,以及(iii)跨模态多头注意力——每种技术为组合模态特异性信号提供了不同的归纳偏置。这些方法不需要对基础模型进行额外的预训练或修改,允许与现有基于序列的基础模型进行简单集成。在五个分子性质预测任务上,BioLangFusion优于强大的单模态基线,表明即使简单融合预训练模型也能以最小开销捕获互补的多组学信息。
引用
@article{arxiv.2506.08936,
title = {BioLangFusion: Multimodal Fusion of DNA, mRNA, and Protein Language Models},
author = {Amina Mollaysa and Artem Moskale and Pushpak Pati and Tommaso Mansi and Mangal Prakash and Rui Liao},
journal= {arXiv preprint arXiv:2506.08936},
year = {2025}
}
备注
Proceedings of ICML 2025 Workshop on Multi-modal Foundation Proceedings of ICML 2025 Workshop on Multi-modal Foundation Proceedings of ICML 2025 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences