中文

大型音频模型的星火:综述与展望

声音 2023-09-25 v3 音频与语音处理

摘要

本综述论文全面概述了将大型语言模型应用于音频信号处理领域的最新进展与挑战。音频处理具有多样的信号表示形式和广泛的来源——从人声到乐器再到环境声音——其面临的挑战不同于传统自然语言处理场景。尽管如此,以基于 transformer 的架构为代表的大型音频模型(Large Audio Models)已在该领域展现出显著成效。通过利用海量数据,这些模型在从自动语音识别、文本到语音合成到音乐生成等多种音频任务中展现了出色的能力。值得注意的是,近来这些基础音频模型(如 SeamlessM4T)已开始展现出作为通用翻译器的能力,支持多达 100 种语言的多种语音任务,而无需依赖独立的任务专用系统。本文深入分析了最先进的基大型音频模型(Foundational Large Audio Models)方法、其性能基准及其在真实场景中的适用性。我们还指出了当前的局限性,并对大型音频模型领域的潜在未来研究方向提供了见解,旨在激发进一步讨论,从而推动下一代音频处理系统的创新。此外,为应对该领域的快速发展,我们将在 https://github.com/EmulationAI/awesome-large-audio-models 持续更新相关仓库,收录近期相关文章及其开源实现。

关键词

引用

@article{arxiv.2308.12792,
  title  = {Sparks of Large Audio Models: A Survey and Outlook},
  author = {Siddique Latif and Moazzam Shoukat and Fahad Shamshad and Muhammad Usama and Yi Ren and Heriberto Cuayáhuitl and Wenwu Wang and Xulong Zhang and Roberto Togneri and Erik Cambria and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2308.12792},
  year   = {2023}
}

备注

Under review, Repo URL: https://github.com/EmulationAI/awesome-large-audio-models