两阶段增强与自适应 CTC 融合提升多流端到端 ASR 的鲁棒性
声音
2021-02-08 v1 计算与语言
音频与语音处理
摘要
当测试声学条件与训练不同时,自动语音识别(ASR)系统性能下降是常见现象。因此,使 ASR 系统对各种环境失真(如背景噪声与混响)具备鲁棒性至关重要。在多流范式中,提升鲁棒性需兼顾处理多种未见的单流条件及流间动态。此前,多流端到端 ASR 中提出了一种实用的两阶段训练策略,其中阶段 2 利用阶段 1 通用特征提取器(UFE)的特征构建多流模型。本文作为其扩展,引入聚焦于不匹配场景的两阶段增强方案:阶段 1 增强旨在通过数据增强技术处理单流输入多样性;阶段 2 时间掩码对随机选定流的 UFE 特征施加时间掩码以模拟多样流组合。推理时,我们还借助分层注意力机制提出自适应连接主义时序分类(CTC)融合。实验在两个数据集 DIRHA 与 AMI 上作为多流场景开展。相较先前训练策略,在多个未见流组合上取得了显著改进,相对词错率降低 29.7%–59.3%。
引用
@article{arxiv.2102.03055,
title = {Two-Stage Augmentation and Adaptive CTC Fusion for Improved Robustness of Multi-Stream End-to-End ASR},
author = {Ruizhi Li and Gregory Sell and Hynek Hermansky},
journal= {arXiv preprint arXiv:2102.03055},
year = {2021}
}
备注
Accepted at IEEE SLT 2021