ViDA-MAN:面向数字人的视觉对话
计算机视觉与模式识别
2021-10-27 v1
摘要
我们展示了ViDA-MAN,一个用于多模态交互的数字人智能体,其对即时语音询问提供实时的视听响应。与传统的基于文本或语音的系统相比,ViDA-MAN提供类人交互(例如,生动语音、自然面部表情与身体手势)。给定语音请求,该演示能够以亚秒级延迟用高质量视频响应。为提供沉浸式用户体验,ViDA-MAN无缝集成了多模态技术,包括语音识别(ASR)、多轮对话、语音合成(TTS)、说话头视频生成。依托大型知识库,ViDA-MAN能够与用户就多个话题聊天,包括闲聊、天气、设备控制、新闻推荐、酒店预订,以及通过结构化知识回答问题。
引用
@article{arxiv.2110.13384,
title = {ViDA-MAN: Visual Dialog with Digital Humans},
author = {Tong Shen and Jiawei Zuo and Fan Shi and Jin Zhang and Liqin Jiang and Meng Chen and Zhengchen Zhang and Wei Zhang and Xiaodong He and Tao Mei},
journal= {arXiv preprint arXiv:2110.13384},
year = {2021}
}