中文

级联和直接语音到文本翻译中的韵律:以韩语Wh-短语为例

计算与语言 2024-02-02 v1

摘要

语音到文本翻译(S2TT)通常通过级联系统处理,其中语音识别系统生成转录,随后传递给翻译模型。尽管人们对开发直接语音翻译系统以避免传播错误和丢失非语言内容越来越感兴趣,但先前在直接S2TT方面的工作难以最终确定将声学信号直接整合到翻译过程中的优势。本文提出使用对比评估来定量衡量直接S2TT系统在韵律起关键作用的语句中消除歧义的能力。具体来说,我们在一个包含Wh-短语的测试集上评估了韩语-英语翻译系统,对于这些短语,韵律特征对于生成具有正确意图的翻译是必要的,无论是陈述句、是非问句、特殊问句等。我们的结果清楚地证明了直接翻译系统相对于级联翻译模型的价值,在歧义情况下的总体准确率提高了12.9%,并且在其中一个主要意图类别中F1分数提高了高达15.6%。据我们所知,本文是第一个提供定量证据表明直接S2TT模型可以有效利用韵律的工作。我们的评估代码是公开可访问的,可供审查和使用。

关键词

引用

@article{arxiv.2402.00632,
  title  = {Prosody in Cascade and Direct Speech-to-Text Translation: a case study on Korean Wh-Phrases},
  author = {Giulio Zhou and Tsz Kin Lam and Alexandra Birch and Barry Haddow},
  journal= {arXiv preprint arXiv:2402.00632},
  year   = {2024}
}

备注

Accepted at Findings of EACL 2024