UniTalker:对话式语音-视觉合成
音频与语音处理
2025-08-08 v2
摘要
对话式语音合成 (CSS) 是用户-智能体交互领域的一项关键任务,旨在为用户生成更具表现力和共情能力的语音。然而,众所周知,“倾听”和“眼神交流”在现实人际沟通中传达情感时起着至关重要的作用。现有的 CSS 研究仅限于感知对话上下文中的文本和语音,这限制了其有效性。此外,纯语音的回复进一步限制了交互体验。为了解决这些局限性,我们引入了对话式语音-视觉合成 (CSVS) 任务,作为传统 CSS 的扩展。通过利用多模态对话上下文,它为用户提供连贯的视听回复。为此,我们开发了一个名为 UniTalker 的 CSVS 系统,这是一个无缝集成多模态感知和多模态渲染能力的统一模型。具体而言,它利用大规模语言模型全面理解对话上下文中的多模态线索,包括说话人、文本、语音和说话人脸动画。随后,它采用多任务序列预测,首先推断目标话语的情感,然后生成共情语音和自然的说话人脸动画。为确保生成的语音-视觉内容在情感、内容和时长上保持一致,我们引入了三项关键优化:1) 设计一种专用的神经关键点编解码器,以对表情序列进行标记化和重建;2) 提出一种双模态语音-视觉硬对齐解码策略;3) 在生成阶段应用情感引导的渲染。全面的客观和主观实验表明,我们的模型合成了更具共情能力的语音,并为用户提供了更自然且情感一致的说话人脸动画。
引用
@article{arxiv.2508.04585,
title = {UniTalker: Conversational Speech-Visual Synthesis},
author = {Yifan Hu and Rui Liu and Yi Ren and Xiang Yin and Haizhou Li},
journal= {arXiv preprint arXiv:2508.04585},
year = {2025}
}
备注
15 pages, 8 figures, Accepted by ACM MM 2025