联合语音识别与音频描述
音频与语音处理
2022-02-04 v1 计算与语言
声音
摘要
在室内外环境录制的语音样本常受次级音频源污染。多数端到端单声道语音识别系统或使用语音增强去除这些背景声,或训练噪声鲁棒模型。为获得更好的模型可解释性与整体理解,我们旨在将新兴的自动音频描述(AAC)与已被充分研究的自动语音识别(ASR)相结合。AAC 的目标是生成音频样本中内容的自然语言描述。我们提出若干端到端联合建模 ASR 与 AAC 任务的方法,并展示其相对于将这些任务独立建模的传统方法的优势。评估我们所提方法的一大障碍是缺乏同时含语音转写与音频描述的标注音频数据集。因此我们亦通过将干净语音 Wall Street Journal 语料与选自 AudioCaps 数据集的多级背景噪声混合,创建了一个多任务数据集。我们还进行了广泛的实验评估,并显示相较现有最先进 ASR 与 AAC 方法,所提方法有所改进。
引用
@article{arxiv.2202.01405,
title = {Joint Speech Recognition and Audio Captioning},
author = {Chaitanya Narisetty and Emiru Tsunoo and Xuankai Chang and Yosuke Kashiwagi and Michael Hentschel and Shinji Watanabe},
journal= {arXiv preprint arXiv:2202.01405},
year = {2022}
}
备注
5 pages, 2 figures. Accepted for ICASSP 2022