M³PDB:面向语音生成的大型多模态、多标签、多语言提示数据库
音频与语音处理
2025-08-14 v1 声音
摘要
近期零样文本音生成技术的进展使得模型能够从语音提示中合成模仿说话者身份和说话风格的语音。然而,这些模型在实际场景中受限显著,因为高质量的语音提示缺失、不完整或超出域范围。此问题主要源于模型训练所使用的语音数据与推理期间输入语音提示之间的显著质量不匹配。为解决此问题,我们引入M³PDB(Multimodal, Multi-Label, Multilingual Prompt Database),这是第一个大规模、多模态、多标签和多语言提示数据库,旨为语音生成中的鲁棒提示选择。我们的数据集构建利用新颖的多模态、多智能体标注框架,实现了跨多种模态的精确和分层标注。此外,我们提出了一种轻量且有效的提示选择策略,适用于实时、资源受限的推理设置。实验结果表明,我们提出的数据库和选择策略有效支持各种具有挑战性的语音生成场景。我们希望我们的工作能激发社区将注意力从提升标准基准上的性能转向语音生成中更现实和多样化的应用场景。代码和数据集均可在 https://github.com/hizening/M3PDB 获取。
引用
@article{arxiv.2508.09702,
title = {$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation},
author = {Boyu Zhu and Cheng Gong and Muyang Wu and Ruihao Jing and Fan Liu and Xiaolei Zhang and Chi Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2508.09702},
year = {2025}
}