TorchAudio 2.1:为 PyTorch 推进语音识别、自监督学习与音频处理组件
音频与语音处理
2023-10-30 v1 声音
摘要
TorchAudio 是为 PyTorch 构建的开源音频与语音处理库。它旨在通过提供设计良好、易用且高效的 PyTorch 组件,加速音频与语音技术的研究与开发。其贡献者定期与用户交流以了解需求,并通过开发有影响力的功能来满足需求。在此,我们概述 TorchAudio 的开发原则与内容,并重点介绍其最新版本(2.1)中的关键功能:自监督学习预训练流水线及训练方案、高性能 CTC 解码器、语音识别模型及训练方案、先进的媒体 I/O 能力,以及用于强制对齐、多通道语音增强和无参考语音评估的工具。针对其中部分功能,我们通过实证研究表明了它们的有效性,并展示其达到了具有竞争力或最先进的性能。
引用
@article{arxiv.2310.17864,
title = {TorchAudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for PyTorch},
author = {Jeff Hwang and Moto Hira and Caroline Chen and Xiaohui Zhang and Zhaoheng Ni and Guangzhi Sun and Pingchuan Ma and Ruizhe Huang and Vineel Pratap and Yuekai Zhang and Anurag Kumar and Chin-Yun Yu and Chuang Zhu and Chunxi Liu and Jacob Kahn and Mirco Ravanelli and Peng Sun and Shinji Watanabe and Yangyang Shi and Yumeng Tao and Robin Scheibler and Samuele Cornell and Sean Kim and Stavros Petridis},
journal= {arXiv preprint arXiv:2310.17864},
year = {2023}
}