Q-BIOLAT:面向QUBO优化的二元潜变量蛋白质适应度景观
机器学习
2026-03-31 v1
摘要
蛋白质适应度优化本质上是一个离散组合问题,然而大多数基于学习的方法依赖于连续表示,并且主要通过预测精度进行评估。我们提出了Q-BIOLAT,一个在紧凑二元潜空间中建模和优化蛋白质适应度景观的框架。从预训练的蛋白质语言模型嵌入开始,我们构建二元潜表示,并学习一个二次无约束二元优化(QUBO)代理模型,该模型捕获一元和成对相互作用。除了其公式化之外,Q-BIOLAT还提供了一种以表示为中心的蛋白质适应度建模视角。我们表明,具有相似预测性能的表示可以诱导出根本不同的优化景观。特别是,基于学习的自编码器表示在二值化后崩溃,产生退化的潜空间,无法支持组合搜索,而简单的结构化表示(如PCA)则产生高熵、可解码且利于优化的潜空间。在多个数据集和数据体制下,我们证明了经典组合优化方法,包括模拟退火、遗传算法和贪婪爬山法,在结构化二元潜空间中非常有效。通过以QUBO形式表达目标函数,我们的方法将现代机器学习与离散和量子启发式优化联系起来。我们的实现和数据集公开于:https://github.com/HySonLab/Q-BIOLAT-Extended
引用
@article{arxiv.2603.27526,
title = {Q-BIOLAT: Binary Latent Protein Fitness Landscapes for QUBO-Based Optimization},
author = {Truong-Son Hy},
journal= {arXiv preprint arXiv:2603.27526},
year = {2026}
}