中文

面向表达性语音到语音翻译的整体级联系统、基准测试集与人工评估协议

计算与语言 2023-01-26 v1 声音 音频与语音处理

摘要

表达性语音到语音翻译(S2ST)旨在将源语音的韵律属性迁移到目标语音,同时保持翻译准确性。现有表达性 S2ST 的研究有限,通常一次仅关注单一表达性方面。同样,该研究领域缺乏标准评估协议和精心整理的基准数据集。在本工作中,我们提出了一种用于表达性 S2ST 的整体级联系统,结合了先前仅被孤立考虑过的多种韵律迁移技术。我们整理了一个电视剧领域的基准表达性测试集,并探索了有声书领域的第二个数据集。最后,我们提出了一种人工评估协议,用于评估语音对之间的多个表达性维度。实验结果表明,双语标注者能够评估 S2ST 系统中表达性保持的质量,且整体建模方法优于单方面系统。音频样本可通过我们的演示网页访问:https://facebookresearch.github.io/speech_translation/cascade_expressive_s2st。

关键词

引用

@article{arxiv.2301.10606,
  title  = {A Holistic Cascade System, benchmark, and Human Evaluation Protocol for Expressive Speech-to-Speech Translation},
  author = {Wen-Chin Huang and Benjamin Peloquin and Justine Kao and Changhan Wang and Hongyu Gong and Elizabeth Salesky and Yossi Adi and Ann Lee and Peng-Jen Chen},
  journal= {arXiv preprint arXiv:2301.10606},
  year   = {2023}
}

备注

This is the full version of our submission to ICASSP 2023