中文

具有百万上下文长度的原始音频语言模型

声音 2024-12-24 v3 机器学习 音频与语音处理

摘要

对音频信号长期依赖关系建模是一个尤其具有挑战性的问题,因为即便很小的时间尺度也会产生约十万量级的样本。随着近期 Transformer 的出现,神经架构擅长建模更长时间尺度上的依赖关系,但它们受限于二次方约束而难以扩展。我们提出了一种生成式自回归架构,能够建模超过 500,000 个样本的大上下文音频波形。我们的工作通过 CNN 前端学习潜表示来学习时间依赖关系,然后使用 Transformer 编码器学习这些表示之间的依赖关系,并进行端到端完全训练:从而允许按其认为适合下一样本的方式学习表示。与以往比较不同时间尺度以展示改进的工作不同,我们使用标准数据集,在相同的参数量/上下文下展示改进。我们在用于建模长期结构的标准数据集上,相对于 Wavenet、SaSHMI 和 Sample-RNN 等其他方法取得了最先进的性能。鉴于上下文建模的改进可随更多数据扩展,以及通过使用数十亿/数万亿参数可能获得更好结果,本工作为该领域提供了非常令人振奋的方向。

关键词

引用

@article{arxiv.2206.08297,
  title  = {A Language Model With Million Context Length For Raw Audio},
  author = {Prateek Verma},
  journal= {arXiv preprint arXiv:2206.08297},
  year   = {2024}
}

备注

5 pages, 1 figure. Technical Report at Stanford University