中文

TorchAudio:音频与语音处理的构建模块

音频与语音处理 2022-02-17 v2 声音

摘要

本文档描述 TorchAudio 0.10 版:音频与语音处理领域的机器学习构建模块。TorchAudio 的目标是通过提供即用构建模块,加速研究人员与工程师的机器学习应用开发与部署。这些构建模块设计为兼容 GPU、自动可微且可用于生产。TorchAudio 可轻松从 Python Package Index 仓库安装,其源代码以 BSD-2-Clause 许可证(截至 2021 年 9 月)公开于 https://github.com/pytorch/audio。本文档中,我们概述 TorchAudio 的设计原则、功能与基准。我们还对若干音频与语音操作及模型的实现进行了基准测试。我们通过基准测试验证,各类操作与模型的实现均正确有效,且性能与其他公开实现相似。

关键词

引用

@article{arxiv.2110.15018,
  title  = {TorchAudio: Building Blocks for Audio and Speech Processing},
  author = {Yao-Yuan Yang and Moto Hira and Zhaoheng Ni and Anjali Chourdia and Artyom Astafurov and Caroline Chen and Ching-Feng Yeh and Christian Puhrsch and David Pollack and Dmitriy Genzel and Donny Greenberg and Edward Z. Yang and Jason Lian and Jay Mahadeokar and Jeff Hwang and Ji Chen and Peter Goldsborough and Prabhat Roy and Sean Narenthiran and Shinji Watanabe and Soumith Chintala and Vincent Quenneville-Bélair and Yangyang Shi},
  journal= {arXiv preprint arXiv:2110.15018},
  year   = {2022}
}

备注

Accepted by ICASSP 2022