中文

SpeechAlign:一种语音翻译对齐评估框架

计算与语言 2024-04-26 v2

摘要

语音到语音和语音到文本翻译目前是活跃的研究领域。为推动这些领域发展,我们提出SpeechAlign,一个旨在评估语音模型中尚未充分探索的源–目标对齐领域的框架。SpeechAlign框架有两个核心组件。首先,为解决缺乏合适评估数据集的问题,我们引入了Speech Gold Alignment数据集,其构建于一个英德文本翻译黄金对齐数据集之上。其次,我们引入两个新指标:语音对齐错误率(SAER)和时间加权语音对齐错误率(TW-SAER),它们能够评估语音模型中的对齐质量。前者对每个词赋予同等重要性,而后者根据语音信号中词的长度分配权重。通过发布SpeechAlign,我们提供了一个可访问的模型评估框架,并利用它对开源语音翻译模型进行基准测试。由此,我们为语音到语音和语音到文本翻译领域的持续研究进展做出贡献。

关键词

引用

@article{arxiv.2309.11585,
  title  = {SpeechAlign: a Framework for Speech Translation Alignment Evaluation},
  author = {Belen Alastruey and Aleix Sant and Gerard I. Gállego and David Dale and Marta R. Costa-jussà},
  journal= {arXiv preprint arXiv:2309.11585},
  year   = {2024}
}

备注

LREC-COLING 2024