AgentAvatar:解耦规划、驱动与渲染以实现照片级真实感虚拟人代理
计算机视觉与模式识别
2023-12-05 v3
摘要
在本研究中,我们的目标是创建能够从视觉与行为双重角度自主规划并真实动画化细腻面部运动的交互式虚拟人代理。给定关于环境与代理属性的高层输入,我们的框架利用 LLM 生成一系列描述虚拟人代理面部运动的详尽文本。这些描述随后由我们的任务无关驱动引擎处理为运动 token 序列,进而被转换为连续运动嵌入,并由我们独立的基于神经网络的渲染器消费以生成最终的照片级真实感虚拟人动画。这些精简的流程使我们的框架能适配多种非言语虚拟人交互,包括单体与双体交互。我们广泛的实验研究涵盖在新编译与已有数据集上的测试,涉及两类代理——一类能与环境进行单体交互,另一类为双体对话设计——验证了方法的有效性与通用性。据我们所知,我们通过结合 LLM 与神经渲染来实现虚拟人代理的通用非言语预测与照片级真实感渲染,迈出了飞跃性的一步。
引用
@article{arxiv.2311.17465,
title = {AgentAvatar: Disentangling Planning, Driving and Rendering for Photorealistic Avatar Agents},
author = {Duomin Wang and Bin Dai and Yu Deng and Baoyuan Wang},
journal= {arXiv preprint arXiv:2311.17465},
year = {2023}
}
备注
Project page: https://dorniwang.github.io/AgentAvatar_project/