中文

ProtTeX-CC:通过两阶段指令压缩激活蛋白 LLM 中的情境学习

机器学习 2025-08-19 v1 人工智能 定量方法

摘要

最近的蛋白质大语言模型(如ProtTeX)代表了侧链氨基酸和主链结构作为残基长度的离散标记序列。虽然这种设计使其能够统一建模多模态蛋白质信息,但存在两个主要局限性:(1)序列和结构标记的串联大约使蛋白质长度翻倍,破坏了模态之间固有的残基级对齐。(2)受限于训练语料和有限的上下文窗口,ProtTeX通常在单个蛋白质输入上进行训练,因而与情境学习(ICL)不兼容,从而限制了其泛化能力。为此,我们提出ProtTeX-CC,一个轻量级两阶段压缩框架,旨在提升ProtTeX在few-shot 设置下的性能。我们首先设计了一种联合嵌入压缩机制,在残基级别融合序列和结构表示,有效地将蛋白质输入长度缩短一半,同时不牺牲性能。然后我们提出一种自压缩模块,将每个完整演示聚合到最后几几个语言标记的潜在空间中,将平均演示长度从751个标记缩短到不足16个标记。在16-shot 设置下,与原始ProtTeX相比,我们的自压缩方法实现了约93.68%的总提示长度压缩比。虽未修改主干模型,ProtTeX-CC仅通过联合嵌入压缩阶段基于PEFT的调谐引入少量额外参数,并在自压缩阶段添加一个可训练的投影层。广泛的实验表明,ProtTeX-CC在蛋白质功能预测任务上,较原始ProtTeX在领域内基准上提升了2%,并在领域外数据集上实现了11%的性能提升。

关键词

引用

@article{arxiv.2508.12212,
  title  = {ProtTeX-CC: Activating In-Context Learning in Protein LLM via Two-Stage Instruction Compression},
  author = {Chuanliu Fan and Zicheng Ma and Jun Gao and Nan Yu and Jun Zhang and Ziqiang Cao and Yi Qin Gao and Guohong Fu},
  journal= {arXiv preprint arXiv:2508.12212},
  year   = {2025}
}