中文

学习音频的连续表示以实现任意尺度超分辨率

声音 2022-03-31 v2 机器学习 音频与语音处理

摘要

音频超分辨率旨在预测低分辨率音频信号中缺失的高分辨率分量。虽然音频本质上是连续信号,当前方法将其视为离散数据(即输入定义在离散时域上),并考虑固定尺度因子的超分辨率(即改变输出分辨率需训练新的神经网络)。为获得音频的连续表示并实现任意尺度因子的超分辨率,我们提出一种隐式神经表示方法,称为任意尺度超分辨率的局部隐式表示(LISA)。我们的方法将一段音频局部参数化为连续时间的函数,并用邻近块的局部潜码表示每个块,使该函数可在任意时间坐标外推信号,即无限分辨率。为学习音频的连续表示,我们设计了一种自监督学习策略,通过随机选取来练习直至原始分辨率的超分辨率任务。我们的数值评估表明,LISA以极少比例的参数优于先前固定尺度的方法,并且还能够进行任意尺度超分辨率,甚至超越训练数据的分辨率。

关键词

引用

@article{arxiv.2111.00195,
  title  = {Learning Continuous Representation of Audio for Arbitrary Scale Super Resolution},
  author = {Jaechang Kim and Yunjoo Lee and Seunghoon Hong and Jungseul Ok},
  journal= {arXiv preprint arXiv:2111.00195},
  year   = {2022}
}

备注

Accepted by ICASSP 2022. The source code is available at https://github.com/ml-postech/LISA