关于生物序列空间函数的学习:关联高斯过程先验、正则化与规范化
机器学习
2025-08-05 v3 基因组学
机器学习
摘要
从生物序列(DNA、RNA、蛋白质)映射到序列功能的定量度量的任务在当代生物学中占据重要位置。我们感兴趣的是相关任务:(i) 推断预测的序列到功能图,和 (ii) 分解序列-功能图以阐明单个子序列的贡献。由于每种序列-功能图都可以表示为多个子序列加权和的形式,对于这些权重进行有意义的解释需要“规范化”,即为每个图定义唯一的表示。最近的工作表明,大多数现有的规范化表示都来源于来自正则化回归的唯一解,这种回归在参数化“权空间”中进行,其中正则化器的选择定义了规范化。本文建立了参数化权空间中正则化回归与 operate in "function space"(即所有有限序列实值函数的空间)中的高斯过程方法之间的关系。我们阐明了权空间正则化器如何同时对学习函数施加隐式先验,并将最优权重限制到特定规范化。我们展示了如何构建对应于任意显式高斯过程先验的正则化器,并 characterize 了与最常见权空间正则化器相关的隐式函数空间先验。最后,我们推导了广泛类序列到功能统计量的后验分布,包括规范化权重以及表达更高阶遗传系数的多种系统。我们表明,这些分布可以针对乘积核先验使用核技巧高效计算。
引用
@article{arxiv.2504.19034,
title = {On learning functions over biological sequence space: relating Gaussian process priors, regularization, and gauge fixing},
author = {Samantha Petti and Carlos Martí-Gómez and Justin B. Kinney and Juannan Zhou and David M. McCandlish},
journal= {arXiv preprint arXiv:2504.19034},
year = {2025}
}