中文

基于 Walk-Jump 采样的数据依赖平滑用于蛋白质发现

机器学习 2025-09-03 v1 定量方法

摘要

扩散模型作为一种强大的生成模型,通过学习迭代逆转噪声过程的能力,已扩展到蛋白质等复杂领域,其中数据分布通常稀疏且在数据空间中分布不均。重要的是,稀疏性本身也具有不均匀性。我们经验上观察到,虽然少数样本位于密集簇中,但大多数样本占据数据空间中稀疏程度不同的区域。现有方法基本上忽略了这种数据依赖的可变性。本文引入了数据依赖平滑 Walk-Jump 框架,该框架在预处理步骤中使用核密度估计 (KDE) 估计每个数据点的噪声尺度 σ\sigma,随后使用这些数据依赖的 σ\sigma 值训练评分模型。通过将局部数据几何纳入去噪过程,我们的方法考虑了蛋白质数据的异构分布。经验评估表明,我们的方法在多个指标上均实现了持续的改进,凸显了在稀疏、高维设置下,数据感知的 sigma 预测对生成模型至关重要。

关键词

引用

@article{arxiv.2509.02069,
  title  = {Data-Dependent Smoothing for Protein Discovery with Walk-Jump Sampling},
  author = {Srinivas Anumasa and Barath Chandran. C and Tingting Chen and Dianbo Liu},
  journal= {arXiv preprint arXiv:2509.02069},
  year   = {2025}
}