中文

生成分布嵌入:将自动编码器提升至分布空间以实现多尺度表示学习

机器学习 2026-02-23 v2 定量方法 机器学习

摘要

许多真实世界问题需要跨尺度推理,要求模型不仅处理单个数据点,还要处理整个分布。我们提出生成分布嵌入(GDE)框架,将自动编码器提升至分布空间。在 GDE 中,编码器作用于样本集合,解码器被替换为生成器,以匹配输入分布。该框架通过满足我们称为分布不变性准则的编码器网络,实现对分布的表示学习。我们表明,GDE 在 Wasserstein 空间中学习到预测的充分统计量,使得 latent GDE 距离大致恢复 W2W_2 距离,latent 插值大致恢复高斯和高斯混合分布的最优传输轨迹。我们在合成数据集上系统性地对比 GDE 与现有方法,显示出持续更强的性能。随后我们将 GDE 应用于计算生物学中的六个关键问题:从单细胞 RNA 测序数据(600 万细胞)中学习捐赠者水平表示、捕捉系外克隆动态(15万细胞)、预测扰动对转录组的影响(100 万细胞)、预测扰动对细胞表型的影响(2000 万单细胞图像)、设计人工酵母启动子(3400 万序列)以及病毒蛋白序列的时空建模(100 万序列)。

关键词

引用

@article{arxiv.2505.18150,
  title  = {Generative Distribution Embeddings: Lifting autoencoders to the space of distributions for multiscale representation learning},
  author = {Nic Fishman and Gokul Gowri and Peng Yin and Jonathan Gootenberg and Omar Abudayyeh},
  journal= {arXiv preprint arXiv:2505.18150},
  year   = {2026}
}

备注

NeurIPS 2025