中文

OmniCharacter:迈向具有无缝语音-语言个性交互的沉浸式角色扮演智能体

计算与语言 2025-06-06 v2 计算机视觉与模式识别

摘要

角色扮演智能体得益于大语言模型,是一种新兴的交互式 AI 系统,能够模拟具有多样个性的角色或人物。然而,现有方法主要侧重于以文本形式模仿角色间的对话,忽略了角色的声音特征(如声音风格和情感)在交互中产生的关键作用,而在现实场景中这往往能带来更具沉浸感的体验。为此,我们提出了 OmniCharacter,这是首个实现低延迟沉浸式角色扮演智能体的无缝语音-语言个性交互模型。具体而言,OmniCharacter 使智能体在整个交互过程中始终表现出特定角色的个性特征和声音特征,实现语音与语言响应的混合。为了使模型与语音-语言场景对齐,我们构建了一个名为 OmniCharacter-10K 的数据集,其中包含更具个性的角色(20 个)、具有丰富上下文的多轮对话(10K)以及动态语音响应(135K)。实验结果表明,与现有的角色扮演智能体和主流的语音-语言模型相比,我们的方法在内容和风格上均产生了更好的响应,且响应延迟低至 289ms。代码和数据集可在 https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/OmniCharacter 获取。

关键词

引用

@article{arxiv.2505.20277,
  title  = {OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction},
  author = {Haonan Zhang and Run Luo and Xiong Liu and Yuchuan Wu and Ting-En Lin and Pengpeng Zeng and Qiang Qu and Feiteng Fang and Min Yang and Lianli Gao and Jingkuan Song and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2505.20277},
  year   = {2025}
}

备注

14 pages, 6 figures