丢失的分词:将情境作为解锁生物分子理解的关键——面向科学 LLM
人工智能
2025-10-31 v2
摘要
科学大型语言模型(Sci-LLMs)已成为加速生物学发现的有前景的前沿。然而,这些模型在处理原始生物分子序列时面临根本性挑战——分词困境。无论将序列视为特殊语言而风险丢失功能 motifs 信息,还是作为独立模态引入严重的对齐挑战,当前策略本质上限制了其推理能力。我们挑战了以序列为中心的范式,认为更有效的策略是为 Sci-LLMs 提供来自 established bioinformatics tools 的高层次结构化情境,从而绕过直接解释低层噪声序列数据的需求。通过对领先 Sci-LLMs 在生物学推理任务上的系统性比较,我们测试了三种输入模式:序列唯一、情境唯一以及两者的组合。我们的发现令人震撼:情境唯一的方法在所有其他模式中始终且显著地实现了性能提升。更令人惊讶的是,无论原始序列如何,仅凭其高层次情境的存在,都一致地削弱了性能,表明原始序列充当了信息噪声,即便针对专门的分词方案的模型亦如此。这些结果表明,现有 Sci-LLMs 的主要强项不在于其从零开始解释生物分子语法的新兴能力,而在于其对结构化、人类可读知识进行推理的深刻能力。因此,我们主张将 Sci-LLMs 重新定位为对 expert knowledge 进行推理的强大引擎,而非序列解码器。这项工作为新一类混合科学 AI 代理奠定了基础,将发展焦点从直接序列解释转向高层次知识综合。代码已公开于 https://github.com/opendatalab-raiser/CoKE。
引用
@article{arxiv.2510.23127,
title = {Lost in Tokenization: Context as the Key to Unlocking Biomolecular Understanding in Scientific LLMs},
author = {Kai Zhuang and Jiawei Zhang and Yumou Liu and Hanqun Cao and Chunbin Gu and Mengdi Liu and Zhangyang Gao and Zitong Jerry Wang and Xuanhe Zhou and Pheng-Ann Heng and Lijun Wu and Conghui He and Cheng Tan},
journal= {arXiv preprint arXiv:2510.23127},
year = {2025}
}
备注
38 pages, under review