超越语音活动检测:面向直接语音翻译的混合音频分割
声音
2021-10-15 v2 计算与语言
音频与语音处理
摘要
训练数据与运行时的数据之间的音频分割不匹配是直接语音翻译中的一个主要问题。事实上,虽然系统通常在人工分割的语料库上训练,但在实际用例中,它们往往面对需要自动(且次优)分割的连续音频。在比较现有技术(基于 VAD、固定长度和混合分割方法)之后,本文我们提出了增强的混合解决方案,以在不牺牲延迟的前提下产生更好的结果。通过对不同领域和语言对的实验,我们表明我们的方法优于所有其他技术,将传统基于 VAD 的方法与最优人工分割之间的差距缩小了至少 30%。
引用
@article{arxiv.2104.11710,
title = {Beyond Voice Activity Detection: Hybrid Audio Segmentation for Direct Speech Translation},
author = {Marco Gaido and Matteo Negri and Mauro Cettolo and Marco Turchi},
journal= {arXiv preprint arXiv:2104.11710},
year = {2021}
}
备注
Accepted to ICNLSP 2021