ProAct:面向主动具身社会代理人的双系统框架
机器人学
2026-02-17 v1 计算机视觉与模式识别
图形学
摘要
具身社会代理人最近在生成同步语音和手势方面取得了进展。然而,大多数交互系统仍然根本上是被动的,仅在短暂的时间窗口内响应当前感官输入。相比之下,主动社会行为需要对积累的上下文进行 deliberation 并进行意图推断,这与实时交互的严格延迟预算相冲突。我们提出了 ProAct,一个双系统框架,通过将低延迟的“行为系统”用于流式多模态交互与较慢的“认知系统”进行长期社交推理并产生高层次的主动意图来解决这一时间尺度冲突。为了在不影响流畅性的情况下将 deliberative 意图转化为连续的非语言行为,我们引入了通过 ControlNet 条件化意图的流式流匹配模型。这一机制支持异步意图注入,使在单个动作流中实现被动与主动手势之间的无缝转换成为可能。我们在物理人形机器人上部署了 ProAct,并评估了运动质量和交互效果。在现实世界的交互用户研究中,参与者和观察者一致偏好 ProAct 而非被动变体,在 perceived proactivity(感知主动性)、social presence(社交存在感)和 overall engagement(整体参与度)方面,展示了双系统主动控制对于具身社交交互的益处。
引用
@article{arxiv.2602.14048,
title = {ProAct: A Dual-System Framework for Proactive Embodied Social Agents},
author = {Zeyi Zhang and Zixi Kang and Ruijie Zhao and Yusen Feng and Biao Jiang and Libin Liu},
journal= {arXiv preprint arXiv:2602.14048},
year = {2026}
}
备注
Project Page: https://proactrobot.github.io/