SARAH:具空间感知的实时智能人类
计算机视觉与模式识别
2026-02-23 v1
摘要
随着具身智能体在 VR、远程演示和数字人应用中扮演越来越重要的角色,其运动必须超越语音对齐的手势:智能体应朝向用户转身、响应他们的运动并维持自然的凝视。当前方法缺乏这种空间感知能力。我们通过首个实时、完全因果的方法来弥合这一差距,实现面向空间的对话运动,可在流式 VR 头戴式设备上部署。给定用户的位置和二元音频,我们的方法产生全身运动,使手势与语音一致,同时根据用户方向智能体。我们的架构将因果变换器基变分自编码器与交错潜在标记相结合,用于流式推理,并有一个条件于用户轨迹和音频的流匹配模型。为支持不同的凝视偏好,我们引入一种凝视评分机制,采用无分类器引导将学习与控制解耦:模型从数据中捕获自然的空间对齐,而用户可在推理时调整眼神接触强度。我们在 Embody 3D 数据集上实现了超过 300 FPS 的最先进运动质量——快于非因果基线 3 倍——同时捕捉自然对话中细微的空间动态。我们在实际 VR 系统上验证了该方法,使具空间感知的对话智能体实现了实时部署。详情请参见 https://evonneng.github.io/sarah/。
引用
@article{arxiv.2602.18432,
title = {SARAH: Spatially Aware Real-time Agentic Humans},
author = {Evonne Ng and Siwei Zhang and Zhang Chen and Michael Zollhoefer and Alexander Richard},
journal= {arXiv preprint arXiv:2602.18432},
year = {2026}
}
备注
Project page: https://evonneng.github.io/sarah/