学习神经场的信号无关流形
机器学习
2021-11-12 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
深度神经网络已被广泛用于跨图像、形状和音频信号等模态学习数据集的潜在结构。然而,现有模型通常依赖于模态,需要定制的架构与目标来处理不同类别的信号。我们利用神经场以模态无关的方式捕获图像、形状、音频以及跨模态视听域中的底层结构。我们将任务视为学习一个流形,旨在推断数据所在的低维局部线性子空间。通过强制流形的覆盖性、局部线性和局部等距,我们的模型——称为 GEM——学会了捕获跨模态数据集的底层结构。我们随后可沿流形的线性区域行进,以获得样本间感知一致的插值,并可进一步使用 GEM 恢复流形上的点,不仅获得输入图像的多样补全,还有音频或图像信号的跨模态幻觉。最后,我们展示通过行走于 GEM 的底层流形之上,我们可在信号域中生成新样本。代码与额外结果见 https://yilundu.github.io/gem/。
引用
@article{arxiv.2111.06387,
title = {Learning Signal-Agnostic Manifolds of Neural Fields},
author = {Yilun Du and Katherine M. Collins and Joshua B. Tenenbaum and Vincent Sitzmann},
journal= {arXiv preprint arXiv:2111.06387},
year = {2021}
}
备注
NeurIPS 2021, additional results and code at https://yilundu.github.io/gem/