中文

面向虚拟人类的多模态对话数据集 MM-Conv

计算机视觉与模式识别 2024-10-02 v1 计算与语言 图形学 人机交互

摘要

本文提出一种新型数据集,通过 VR 头盔记录 AI2-THOR 物理模拟器中参与者之间的对话。我们的主要目标是将丰富的上下文信息纳入指代性场景,以扩展共说话手势生成领域。参与者参与了基于指代性通信任务的各种对话情景。数据集提供了丰富的多模态录音,包括运动捕捉、语音、注视和场景图。这个全面的数据集旨在通过提供多样且富有上下文信息的数据,增强对 3D 场景下手势生成模型的理解和开发。

关键词

引用

@article{arxiv.2410.00253,
  title  = {MM-Conv: A Multi-modal Conversational Dataset for Virtual Humans},
  author = {Anna Deichler and Jim O'Regan and Jonas Beskow},
  journal= {arXiv preprint arXiv:2410.00253},
  year   = {2024}
}