中文

基于语音语句对的多语种零资源语码转换语音基准

音频与语音处理 2024-03-19 v3 计算与语言 声音

摘要

我们提出了一个新的零资源语码转换语音基准,旨在直接评估自监督语音编码器的语码转换能力。我们展示了一个基于离散单元的语言建模基线系统,以说明如何以零资源方式评估语音编码器的语码转换能力。我们的实验涵盖了多种知名语音编码器,包括 Wav2vec 2.0、HuBERT、XLSR 等。我们考察了预训练语言与模型规模对基准性能的影响。值得注意的是,尽管我们的结果表明具有多语言预训练的语音编码器(以 XLSR 为代表)在语码转换场景中优于单语变体(Wav2vec 2.0、HuBERT),但其语码转换语言能力仍有较大提升空间。

关键词

引用

@article{arxiv.2310.03018,
  title  = {Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages},
  author = {Kuan-Po Huang and Chih-Kai Yang and Yu-Kuan Fu and Ewan Dunbar and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2310.03018},
  year   = {2024}
}

备注

Accepted by ICASSP 2024 (v2)