基于 Rosetta VAE 的可复现增量表示学习
机器学习
2022-01-17 v1
摘要
变分自编码器 (VAE) 是从高维数据中提取低维结构的最流行方法之一,使其作为数据探索和科学发现的工具日益重要。然而,与在单个大型数据集上一次性训练单个模型的典型机器学习问题不同,科学工作流更青睐那些可复现、可跨实验室移植且能够增量添加新数据的已学习特征。理想情况下,不同研究团队使用的方法应能产生可比的结果,即使不共享完全训练好的模型或完整数据集。在此,我们通过引入 Rosetta VAE (R-VAE) 来应对这一挑战,该方法能够提取先前学习的表示并重新训练新模型,以复现并在先前结果的基础上继续构建。R-VAE 在完全训练好的模型的潜在空间上使用事后聚类,以识别少量 Rosetta 点(输入与潜在表示对),作为训练未来模型的锚点。一个可调超参数 用于平衡对先前学习潜在空间的保真度与新数据的容纳度。我们证明,R-VAE 的数据重建效果与 VAE 和 -VAE 相当,在序列训练设置中目标潜在空间的恢复方面优于这两种方法,并显著提高了不同训练轮次间学习表示的一致性。
引用
@article{arxiv.2201.05206,
title = {Reproducible, incremental representation learning with Rosetta VAE},
author = {Miles Martinez and John Pearson},
journal= {arXiv preprint arXiv:2201.05206},
year = {2022}
}
备注
16 pages, 7 figures, Bayesian Deep Learning Workshop at Neurips 2021