SOLAMI:面向沉浸式交互的社交视觉语言动作建模
计算机视觉与模式识别
2024-12-03 v1 人工智能
机器学习
摘要
人类是社会动物。如何为 3D 自主角色赋予类似人类的社交智能,以感知、理解和与人类交互,仍是开放且根本性的问题。本文介绍 SOLAMI,即首个面向沉浸式交互的社交视觉语言动作(VLA)建模框架。具体而言,SOLAMI 从三个方面构建 3D 自主角色:(1)社交 VLA 架构:我们提出统一的社交 VLA 框架,基于用户的多模态输入生成多模态响应(语音和动作),驱动角色进行社交交互。(2)交互式多模态数据:我们呈现 SynMSI,一个由自动化管道仅使用现有动作数据集生成的合成多模态社交交互数据集,以解决数据稀缺的问题。(3)沉浸式 VR 界面:我们开发了一个 VR 界面,使用户能够与由各种架构驱动的角色进行沉浸式交互。广泛的定量实验和用户研究表明,我们的框架导致更精确、更自然的字符响应(在语音和动作方面),符合用户期望,同时延迟更低。
引用
@article{arxiv.2412.00174,
title = {SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters},
author = {Jianping Jiang and Weiye Xiao and Zhengyu Lin and Huaizhong Zhang and Tianxiang Ren and Yang Gao and Zhiqian Lin and Zhongang Cai and Lei Yang and Ziwei Liu},
journal= {arXiv preprint arXiv:2412.00174},
year = {2024}
}