中文

DiariST:具备说话人日记化的流式语音翻译

音频与语音处理 2024-01-24 v2 计算与语言 声音

摘要

面向对话录音的端到端语音翻译(ST)涉及若干未被充分探索的挑战,例如无准确词级时间戳的说话人日记化(SD),以及以流式方式处理重叠语音。在本工作中,我们提出 DiariST,首个流式 ST 与 SD 解决方案。它构建于基于神经转导器的流式 ST 系统之上,并集成了最初为多说话人语音识别开发的词级序列化输出训练和 t-vector。由于该领域缺乏评测基准,我们通过将 AliMeeting 语料的参考中文转写翻译为英文,构建了新评测数据集 DiariST-AliMeeting。我们还提出称为说话人无关 BLEU 和说话人归属 BLEU 的新指标,以在考虑 SD 精度的同时衡量 ST 质量。与基于 Whisper 的离线系统相比,我们的系统在重叠语音的流式推理中实现了强劲的 ST 与 SD 能力。为促进这一新方向的研究,我们发布了评测数据、离线基线系统及评测代码。

关键词

引用

@article{arxiv.2309.08007,
  title  = {DiariST: Streaming Speech Translation with Speaker Diarization},
  author = {Mu Yang and Naoyuki Kanda and Xiaofei Wang and Junkun Chen and Peidong Wang and Jian Xue and Jinyu Li and Takuya Yoshioka},
  journal= {arXiv preprint arXiv:2309.08007},
  year   = {2024}
}

备注

Accepted to ICASSP 2024