SentiAvatar:面向富有表现力和互动的数字人类
计算机视觉与模式识别
2026-04-21 v2 人机交互
多媒体
摘要
我们提出 SentiAvatar,一个用于构建富有表现力、互动性的3D数字人类框架,并据此构建了 SuSu 虚拟角色,能够实时说话、做手势和表达情绪。实现这一系统仍具有挑战性,因为它需要同时解决三个关键问题:缺乏大规模、高质量的多模态数据、鲁棒的语义到运动映射以及细粒度的帧级运动-抒情同步。为解决这些问题,我们首先构建 SuSuInterActs(21K 片段,37 小时),通过光学运动捕捉获取的对话语料库,包含同步的语音、完整身体动作和面部表情。其次,我们在20万多条运动序列上预训练运动基础模型,赋予其丰富的动作先验,这些先验超越了对话场景。我们随后提出一种音频感知的计划-填充架构,将句子级语义规划与帧级抒情驱动插值解耦,使得生成的运动既在语义上恰当,又与语音节奏同步。实验表明,SentiAvatar 在 SuSuInterActs(R@1 43.64%,几乎是最佳基线的两倍)和 BEATv2(FGD 4.941,BC 8.078)上实现了状态最佳性能,输出6秒所需时间仅为0.3秒,可实现无限多轮流式处理。源码、模型和数据集已在 https://sentiavatar.github.io 提供。
引用
@article{arxiv.2604.02908,
title = {SentiAvatar: Towards Expressive and Interactive Digital Humans},
author = {Chuhao Jin and Rui Zhang and Qingzhe Gao and Haoyu Shi and Dayu Wu and Yichen Jiang and Yihan Wu and Ruihua Song},
journal= {arXiv preprint arXiv:2604.02908},
year = {2026}
}
备注
19 pages, 4 figures