用于口语理解与同声语音翻译的分块流式 Transformer
计算与语言
2022-04-20 v1 声音
音频与语音处理
摘要
尽管 Transformer 已在口语理解(SLU)与语音翻译(ST)等若干语音处理任务中取得成功,但在保持有竞争力性能的同时实现在线处理对真实交互仍至关重要。本文利用基于上下文分块处理与分块同步束搜索的分块流式 Transformer,在流式 SLU 与同声 ST 上迈出第一步。此外,我们为流式 SLU 任务设计了一种基于自动语音识别(ASR)的中间损失正则化,以进一步提升分类性能。对于同声 ST 任务,我们提出一种跨语言编码方法,其采用以目标语言翻译优化的 CTC 分支。并且,CTC 翻译输出也用于以 CTC 前缀得分精炼搜索空间,首次实现联合 CTC/注意力同声翻译。SLU 实验在 FSC 与 SLURP 语料上进行,ST 任务在 Fisher-CallHome Spanish 与 MuST-C En-De 语料上评估。实验结果表明,分块流式 Transformer 相比离线模型取得了有竞争力的结果,尤其结合我们提出的方法后在流式基线上进一步带来 SLU 任务 2.4% 准确率提升与 ST 任务 4.3 BLEU 提升。
引用
@article{arxiv.2204.08920,
title = {Blockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation},
author = {Keqi Deng and Shinji Watanabe and Jiatong Shi and Siddhant Arora},
journal= {arXiv preprint arXiv:2204.08920},
year = {2022}
}
备注
Submitted to Interspeech2022