RSATalker:面向多轮对话的现实感社交感知讲话人生成
计算机视觉与模式识别
2026-01-16 v1
摘要
讲话人生成日益重要于虚拟现实 (VR),尤其是涉及多轮对话的社交场景。现有方法面临显著局限:基于网格的 3D 方法可建模双人对话但缺乏真实纹理,而基于大模型的 2D 方法产生自然外观但计算成本高昂。最近基于 3D 高斯溅写 (3DGS) 的方法实现了高效且真实的渲染,但仅限于单说话者且忽略社交关系。我们引入 RSATalker,首个基于 3DGS 实现支持多轮对话的真实且社交感知的讲话人生成框架。我们的方法首先从 speech 中驱动基于网格的 3D 脸部运动,然后将 3D 高斯绑定到网格面元,以渲染高保真度 2D 头像视频。为捕捉人际互动,我们提出一种社交感知模块,通过可学习的查询机制将社交关系(包括血缘与非血缘关系以及平等与不平等关系)编码为高层嵌入。我们设计三阶段训练范式并构建 RSATalker 数据集,包含 speech-mesh-image 三元组并标注了社交关系。广泛实验表明,RSATalker 在现实感与社交感知方面实现了最佳性能。代码与数据集将公开释放。
引用
@article{arxiv.2601.10606,
title = {RSATalker: Realistic Socially-Aware Talking Head Generation for Multi-Turn Conversation},
author = {Peng Chen and Xiaobao Wei and Yi Yang and Naiming Yao and Hui Chen and Feng Tian},
journal= {arXiv preprint arXiv:2601.10606},
year = {2026}
}