端到端单通道说话人轮次感知的对话语音翻译
计算与语言
2023-11-02 v1 音频与语音处理
摘要
传统的语音到文本翻译(ST)系统在单说话人语句上训练,可能无法推广到包含多人对话的真实场景。本文中,我们处理单通道多说话人对话语音翻译问题,提出一个端到端多任务训练模型,称为说话人轮次感知的对话语音翻译(Speaker-Turn Aware Conversational Speech Translation),该模型使用序列化标注格式中的特殊标记,将自动语音识别、语音翻译和说话人轮次检测相结合。我们在 Fisher-CALLHOME 语料库上运行实验,通过将两个单说话人通道合并为一个多说话人通道来适配该语料,从而代表具有多说话人轮次和串扰的更真实且更具挑战性的场景。在单说话人和多说话人条件下、并与传统 ST 系统对比的实验结果表明,我们的模型在多说话人条件下优于参考系统,同时在单说话人条件下取得可比性能。我们发布了数据处理和模型训练的脚本。
引用
@article{arxiv.2311.00697,
title = {End-to-End Single-Channel Speaker-Turn Aware Conversational Speech Translation},
author = {Juan Zuluaga-Gomez and Zhaocheng Huang and Xing Niu and Rohit Paturi and Sundararajan Srinivasan and Prashant Mathur and Brian Thompson and Marcello Federico},
journal= {arXiv preprint arXiv:2311.00697},
year = {2023}
}
备注
Accepted at EMNLP 2023. Code: https://github.com/amazon-science/stac-speech-translation