用于非母语语音评估的本土母语者投影模拟与潜在语音表示
声音
2024-09-20 v2 音频与语音处理
摘要
评估计算机辅助语言学习系统中的语音可理解性是一项关键任务。传统方法常依赖自动语音识别 (ASR) 提供的词错误率 (WER) 作为可理解性得分。然而,这种方法存在显著局限性,由于人类语音识别 (HSR) 与 ASR 之间的差异。一个有前景的替代方案是让本土 (L1) 母语者投影 (shadowing) 非母语 (L2) 发言人所说的话。L1 母语者在投影过程中的错误或发音不准可作为评估 L2 语音可理解性的指标。在本研究中,我们提出了一个语音生成系统,使用语音转换 (VC) 技术和潜在语音表示模拟 L1 投影过程。我们的实验结果表明,该方法有效地复制了 L1 投影过程,为评估 L2 语音可理解性提供了一个创新的工具。值得注意的是,利用自监督语音表示 (S3R) 的系统在语言准确性和自然度方面更接近真实的 L1 投影话语。
引用
@article{arxiv.2409.11742,
title = {Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations},
author = {Haopeng Geng and Daisuke Saito and Nobuaki Minematsu},
journal= {arXiv preprint arXiv:2409.11742},
year = {2024}
}
备注
Submitted to ICASSP2025 Demo available: https://secondtonumb.github.io/publication_demo/ICASSP_2025/index.html