Tragic Talkers:用于音视频机器学习的莎士比亚式声场与光场数据集
音频与语音处理
2022-12-06 v1 多媒体
声音
摘要
3D音视频制作旨在为消费者提供沉浸式与交互式体验。然而,忠实再现真实世界的3D场景仍是一项挑战。这部分归因于缺乏支持此方向音视频研究的数据集。在大多数现有多视角数据集中, accompanying audio 被忽视。类似地,用于空间音频研究的数据集主要提供单模态内容,即便包含视觉数据,其质量也远未达到标准制作需求。我们提出“Tragic Talkers”,一个由《罗密欧与朱丽叶》戏剧片段组成的音视频数据集,使用麦克风阵列与多台共址相机捕获光场视频。Tragic Talkers为基于对象的媒体(OBM)制作提供了理想内容。其设计涵盖多种常规说话场景,如独白、双人对话以及具有显著运动与遮挡的交互,共生成从22个不同视点及两个16元麦克风阵列捕获的30个序列。此外,我们提供语音活动标签、各相机视角的2D人脸边界框、2D姿态检测关键点、演员嘴部的3D跟踪数据以及对话转录文本。我们相信该数据集将惠及学界,因其可辅助多学科研究。文中讨论了该数据集的可能用途。
引用
@article{arxiv.2212.01892,
title = {Tragic Talkers: A Shakespearean Sound- and Light-Field Dataset for Audio-Visual Machine Learning Research},
author = {Davide Berghi and Marco Volino and Philip J. B. Jackson},
journal= {arXiv preprint arXiv:2212.01892},
year = {2022}
}