MultiGen:面向儿童的多语言语音生成器
音频与语音处理
2025-09-05 v3 人工智能
计算与语言
信号处理
摘要
生成式语音模型在提高人机交互方面展现出巨大潜力,为诸如语言学习等实际应用提供了宝贵的途径。然而,尤其是在跨语言、跨文化语境下实现高质量、儿童友好的语音生成仍具有挑战性。本文提出 MultiGen,一种针对低资源语言的多语言语音生成模型,具有儿童友好的交互特性,利用 LLM 架构进行语音生成,专为低资源语言设计。我们提出将年龄适当的多语言语音生成集成到 LLM 架构中,可用于通过文化相关语境促进年轻孩子与 AI 系统之间的沟通。这三种低资源语言包括新加坡口音普通话、马来语和泰米尔语。来自客观指标和主观评估的实验结果表明,所提出的 MultiGen 在基线方法上表现出优势。
引用
@article{arxiv.2508.08715,
title = {MultiGen: Child-Friendly Multilingual Speech Generator with LLMs},
author = {Xiaoxue Gao and Huayun Zhang and Nancy F. Chen},
journal= {arXiv preprint arXiv:2508.08715},
year = {2025}
}
备注
5 pages