中文

MENASpeechBank:用于AudioLLMs的带人格条件多轮对话参考语音库

声音 2026-02-10 v1 人工智能 计算与语言 音频与语音处理

摘要

Audio大语言模型(AudioLLMs)使语音和通用音频能够遵循指令,但进展受限于缺乏多样化、对话式、指令对齐的语音-文本数据。这一瓶颈在人格化交互和方言覆盖方面尤为突出,因为收集和发布真实的多说话人录音数据成本高昂且耗时。我们介绍了MENASpeechBank,一个约由124名说话人(覆盖多个中东和北非地区)提供约18K条高质量语音的参考语音库,覆盖英语、现代标准阿拉伯语(MSA)和地区阿拉伯方言。基于这一资源,我们开发了一个可控的合成数据管道:(i)构建具有基于世界价值调查(WVS)启发的属性丰富的人格轮廓,(ii)定义约5K种对话场景范畴,(iii)通过语义相似性将人格与场景匹配,(iv)生成约417K条角色扮演对话,其中用户以人格身份发声,助手表现为乐于助人的智能体,(v)以参考说话人音频为条件合成用户发言,以保留说话人身份和多样性。我们对合成语音和人工录制的语音进行了评估,并提供了详细分析。我们将公开发布MENASpeechBank及生成的对话,以供社区使用。

关键词

引用

@article{arxiv.2602.07036,
  title  = {MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs},
  author = {Zien Sheikh Ali and Hunzalah Hassan Bhatti and Rabindra Nath Nandi and Shammur Absar Chowdhury and Firoj Alam},
  journal= {arXiv preprint arXiv:2602.07036},
  year   = {2026}
}

备注

Foundation Models, Large Language Models, Native, Speech Models, Arabic, AI-persona, Persona-conditioned-conversations