Lhotse:面向现代深度学习生态的语音数据表示库
声音
2021-10-26 v1 音频与语音处理
摘要
由于编解码器多样、录音长度不一以及元数据格式各异,语音数据素以难以处理著称。我们提出 Lhotse,一个语音数据表示库,它借鉴了 Kaldi 语音识别工具包的经验教训,并将其概念引入现代深度学习生态。Lhotse 提供了一种通用的 JSON 描述格式,并附带相应的 Python 类以及针对 30 多个流行语音语料库的数据准备脚本。各种数据集可轻松组合并重新用于不同任务。该库支持多通道录音、长录音、本地与云存储、惰性及即时操作等特性。我们引入了 Cut 与 CutSet 概念,简化了音频的常见数据整理任务,并有助于融入语音语句的声学上下文。最后,我们展示了 Lhotse 如何利用 PyTorch 数据 API 抽象并采纳它们以处理深度学习中的语音数据。
引用
@article{arxiv.2110.12561,
title = {Lhotse: a speech data representation library for the modern deep learning ecosystem},
author = {Piotr Żelasko and Daniel Povey and Jan "Yenda" Trmal and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2110.12561},
year = {2021}
}
备注
Accepted for presentation at NeurIPS 2021 Data-Centric AI (DCAI) Workshop