BEAT:用于对话手势合成的大规模语义与情感多模态数据集
计算机视觉与模式识别
2022-09-21 v5 计算与语言
图形学
机器学习
多媒体
摘要
由于缺少可用的数据集、模型和标准化评估指标,实现基于多模态数据条件控制的逼真、生动且类人的合成对话手势仍是一个未解决的问题。为此,我们构建了 Body-Expression-Audio-Text 数据集 BEAT,其具有 i) 从 30 位说话人以八种不同情感和四种不同语言交谈中采集的 76 小时高质量多模态数据,ii) 3200 万帧级情感与语义相关性标注。我们对 BEAT 的统计分析展示了对话手势与面部表情、情感和语义的相关性,此外还包括已知的与音频、文本和说话人身份的相关性。基于该观察,我们提出了基线模型级联运动网络(Cascaded Motion Network, CaMN),其由上述六种模态以级联架构建模用于手势合成。为评估语义相关性,我们引入了指标语义相关手势召回率(Semantic Relevance Gesture Recall, SRGR)。定性与定量实验证明了指标的有效性、真值数据质量以及基线的 SOTA 性能。据我们所知,BEAT 是用于研究人体手势最大的动作捕捉数据集,其可贡献于多个不同研究领域,包括可控手势合成、跨模态分析和情感手势识别。数据、代码和模型可在 https://pantomatrix.github.io/BEAT/ 获取。
引用
@article{arxiv.2203.05297,
title = {BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis},
author = {Haiyang Liu and Zihao Zhu and Naoya Iwamoto and Yichen Peng and Zhengqing Li and You Zhou and Elif Bozkurt and Bo Zheng},
journal= {arXiv preprint arXiv:2203.05297},
year = {2022}
}
备注
28 pages, 15 figures, Accepted by ECCV2022