UniX-Encoder:一种面向自组织麦克风阵列语音处理的通用 $X$ 通道语音编码器
音频与语音处理
2023-10-26 v1
摘要
语音领域正不断发展以解决更具挑战性的场景,例如包含多个同时说话人的多通道录音。鉴于存在多种类型的麦克风配置,我们提出了 UniX-Encoder。它是一个为多种任务设计的通用编码器,可在单人及多说话人环境中与任意麦克风阵列协同工作。我们的研究在四个关键方面增强了以往的多通道语音处理工作:1) 适应性:与受限于特定麦克风阵列配置的传统模型不同,我们的编码器具有普遍兼容性。2) 多任务能力:超越以往系统的单任务聚焦,UniX-Encoder 作为一个鲁棒的上游模型,能熟练地为包括 ASR(自动语音识别)和说话人识别在内的多种任务提取特征。3) 自监督训练:该编码器无需标注的多通道数据即可训练。4) 端到端集成:与先波束成形再处理单通道的模型不同,我们的编码器提供了一种端到端方案,绕过了显式的波束成形或分离。为验证其有效性,我们在来自 LibriSpeech 语料的合成多通道数据集上测试了 UniX-Encoder。在语音识别和说话人日记化等任务中,我们的编码器始终优于 WavLM 模型结合 BeamformIt 前端等组合。
引用
@article{arxiv.2310.16367,
title = {UniX-Encoder: A Universal $X$-Channel Speech Encoder for Ad-Hoc Microphone Array Speech Processing},
author = {Zili Huang and Yiwen Shao and Shi-Xiong Zhang and Dong Yu},
journal= {arXiv preprint arXiv:2310.16367},
year = {2023}
}
备注
Submitted to ICASSP 2024