中文

Allo-AVA:用于异中心虚拟形象手势动画的大规模多模态对话式 AI 数据集

人工智能 2024-10-23 v1 计算与语言 计算机视觉与模式识别

摘要

高质量、多模态训练数据的稀缺严重阻碍了虚拟环境中对话式 AI 创建逼真虚拟形象动画。现有数据集通常缺乏自然人类交流中语音、面部表情和身体动作之间复杂的同步性。为了解决这一关键差距,我们引入了 Allo-AVA,这是一个专门为异中心(第三人称视角)情境下文本和音频驱动的虚拟形象手势动画设计的大规模数据集。Allo-AVA 包含约 1250 小时的多样化视频内容,并配有音频、转录文本和提取的关键点。Allo-AVA 独特地将这些关键点映射到精确的时间戳,从而能够准确复制与语音同步的人类动作(身体和面部手势)。这一综合资源能够开发和评估更自然、上下文感知的虚拟形象动画模型,有可能改变从虚拟现实到数字助理等应用。

关键词

引用

@article{arxiv.2410.16503,
  title  = {Allo-AVA: A Large-Scale Multimodal Conversational AI Dataset for Allocentric Avatar Gesture Animation},
  author = {Saif Punjwani and Larry Heck},
  journal= {arXiv preprint arXiv:2410.16503},
  year   = {2024}
}