中文

蛋白质语言模型中的推理时毒性缓解

机器学习 2026-03-05 v1 人工智能

摘要

蛋白质语言模型(PLMs)正逐渐成为de novo蛋白质设计的实用工具,但其双重用途潜力引发了安全顾虑。我们展示了,即使毒性性质未作为训练目标,针对特定分类学群体的领域适应也可能引发有毒蛋白生成。为此,我们将Logit差放大(LDA)作为PLMs的推理时控制机制进行适应。LDA通过放大基线模型与毒性微调模型之间的logit差异来修改token概率,无需重新训练。在四个分类学群体上,LDA均将预测毒性率(通过ToxDL2衡量)降至分类学微调基准以下,同时保持生物学合理性。我们采用Fréchet ESM Distance和预测折叠性(pLDDT)评估质量,发现LDA保持了与自然蛋白的分布相似性和结构可行性(与基于激活的引导方法不同,后者倾向于降低序列属性)。我们的结果表明,LDA为蛋白质生成器提供了一种实用的安全调节器,在缓解诱发的毒性的同时保持生成质量。

关键词

引用

@article{arxiv.2603.04045,
  title  = {Inference-Time Toxicity Mitigation in Protein Language Models},
  author = {Manuel Fernández Burda and Santiago Aranguri and Iván Arcuschin Moreno and Enzo Ferrante},
  journal= {arXiv preprint arXiv:2603.04045},
  year   = {2026}
}