PersonaPlex:面向全双工对话语音模型的角色与声线控制
计算与语言
2026-02-09 v1
摘要
近期全双工语音模型的进展,使能够实现自然、低延迟的语音到语音交互。然而,现有模型局限于固定角色和声线,限制其支持结构化、角色驱动的现实应用和个性化交互的能力。本文引入PersonaPlex,一种融合混合系统提示的全双工对话语音模型,将角色条件化与文本提示相结合,声线克隆与语音样本相结合。PersonaPlex在大规模合成数据集上进行训练,该数据集由开源大语言模型(LLM)和文本到语音(TTS)模型生成,包含配对的提示与用户-智能体对话。为评估角色条件化在现实场景中的表现,我们将Full-Duplex-Bench基准扩展于单一助手角色至多角色客服场景。实验表明,PersonaPlex在角色条件化行为、声线条件化语音以及自然对话响应方面均表现优异,超越当前最先进的全双工语音模型和基于混合大语言模型的语音系统,在角色遵循性、说话者相似度、延迟和自然度方面取得显著优势。
引用
@article{arxiv.2602.06053,
title = {PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models},
author = {Rajarshi Roy and Jonathan Raiman and Sang-gil Lee and Teodor-Dumitru Ene and Robert Kirby and Sungwon Kim and Jaehyeon Kim and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2602.06053},
year = {2026}
}