中文

MultiActor-Audiobook:基于多演员生成零样本有声书

声音 2025-05-20 v1 人工智能 音频与语音处理

摘要

我们介绍 MultiActor-Audiobook,一种零样本方法,用于生成具有多个说话人面部和声音的有声书,能够自动产生一致的、有表现力的、符合说话人特征的韵律,包括语调和情感。以往的有声书系统存在若干局限:需要用户手动配置说话人韵律、与语音演员相比读句子时声调平淡,或依赖高昂的训练成本。然而,我们的 MultiActor-Audiobook 通过引入两种新方法:(1)MSP(Multimodal Speaker Persona Generation,多模态说话人人格生成)和(2)LSI(LLM-based Script Instruction Generation,基于 LLM 的脚本指令生成)来解决上述问题。通过这两种方法,MultiActor-Audiobook 能在无需额外训练的情况下生成更具情感表达性的有声书,保持一致的说话人韵律。我们通过人类和 MLLM 评估将系统与商业产品进行比较,取得了具竞争力的成绩。此外,我们通过消融研究证明了 MSP 和 LSI 的有效性。

关键词

引用

@article{arxiv.2505.13082,
  title  = {MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers},
  author = {Kyeongman Park and Seongho Joo and Kyomin Jung},
  journal= {arXiv preprint arXiv:2505.13082},
  year   = {2025}
}