中文

探索预训练嵌入在机器引导蛋白质设计中的极限:以预测 AAV 向量可行性为例

量子物理 2026-02-17 v1 计算金融 投资组合管理

摘要

有效的蛋白质序列表征被广泛认为是基于机器学习的蛋白质设计基石。然而,蛋白质生物工程为序列表征带来了独特挑战,因为实验数据集通常包含较少突变,这些突变要么在整个序列中稀疏分布,要么集中在局部区域。这限制了序列级别表征提取功能性有意义信号的能力。此外,综合性比较研究仍稀少,尽管这些研究在阐明哪些表征最能编码相关信息并最终支持卓越预测性能方面至关重要。本研究系统评估了多个 ProtBERT 和 ESM2 嵌入变体作为序列表征,采用 Adeno-Associated Virus 壳环作为案例研究,这是一种典型的生物工程示例,通过在 otherwise庞大的蛋白质中高度局部序列变化进行功能优化。我们的结果表明,在微调之前,氨基酸级别的嵌入在监督预测任务中优于序列级别的表征,而后者则更有效地用于无监督设置。然而,仅当嵌入使用任务特定标签进行微调时,才能实现最佳性能,序列级别的表征提供了最佳性能。此外,我们的发现表明,产生显著位移序列表征所需的序列变化幅度超过通常在生物工程研究中探索的范围,表明在稀疏或高度局部突变数据集中进行微调是必要的。

关键词

引用

@article{arxiv.2602.14827,
  title  = {Constrained Portfolio Optimization via Quantum Approximate Optimization Algorithm (QAOA) with XY-Mixers and Trotterized Initialization: A Hybrid Approach for Direct Indexing},
  author = {Javier Mancilla and Theodoros D. Bouloumis and Frederic Goguikian},
  journal= {arXiv preprint arXiv:2602.14827},
  year   = {2026}
}

备注

11 pages, 6 figures