快速与慢速的转录与翻译:联合语音翻译与识别
音频与语音处理
2024-12-23 v1 计算与语言
摘要
我们提出了联合语音翻译与识别(JSTAR)模型,该模型利用快慢级联编码器架构,实现同时的端到端自动语音识别(ASR)和语音翻译(ST)。该模型基于转换器,并采用多目标训练策略,同时优化 ASR 和 ST 目标。这使得 JSTAR 能够产生高质量的流式 ASR 和 ST 结果。我们将 JSTAR 应用于带有智能眼镜的双语对话语音场景,其中模型还被训练以区分对应佩戴者和对话伙伴的不同方向的语音。我们研究了不同的模型预训练策略以进一步提升结果,包括首次训练基于转换器的流式机器翻译(MT)模型并将其应用于 JSTAR 的参数初始化。我们展示了 JSTAR 在 BLEU 分数和延迟方面均优于强级联 ST 模型。
引用
@article{arxiv.2412.15415,
title = {Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition},
author = {Niko Moritz and Ruiming Xie and Yashesh Gaur and Ke Li and Simone Merello and Zeeshan Ahmed and Frank Seide and Christian Fuegen},
journal= {arXiv preprint arXiv:2412.15415},
year = {2024}
}
备注
Submitted to ICASSP 2025