固定码率预算下用于远场自动语音识别的多通道 Opus 压缩
音频与语音处理
2021-06-16 v1 声音
摘要
云端自动语音识别(ASR)相较于设备端处理,可使用更大模型与更强大的多通道信号处理前端。然而,它也因音频信号传输引入了固有延迟,尤其在传输麦克风阵列多通道时。降低网络带宽需求的一种方式是使用 Opus 等有损编解码器在客户端进行压缩。但该压缩尤其会对多通道 ASR 前端产生不利影响,因为编解码器引入的失真与空间信息丢失所致。本文中,我们提出一种基于 Opus 的改进麦克风阵列信号压缩方法,采用修正的联合信道编码方案,并额外引入多通道空间去相关变换以降低传输冗余。我们阐明了所提方法对压缩后多通道信号保留空间信息的影响,并在带多通道波束赋形前端的远场 ASR 上评估了性能。我们证明,在七通道设置下,对于固定码率预算,我们的方法可实现 37.5% 的码率降低或 5.1% 的相对词错误率降低。
引用
@article{arxiv.2106.07994,
title = {Multi-channel Opus compression for far-field automatic speech recognition with a fixed bitrate budget},
author = {Lukas Drude and Jahn Heymann and Andreas Schwarz and Jean-Marc Valin},
journal= {arXiv preprint arXiv:2106.07994},
year = {2021}
}
备注
Accepted at Interspeech 2021