EasyCom:支持嘈杂环境中便捷通信算法的增强现实数据集
声音
2021-10-20 v2 计算机视觉与模式识别
机器学习
音频与语音处理
信号处理
摘要
增强现实(AR)作为一个平台,有潜力助力缓解鸡尾酒会效应。未来的 AR 头显可能利用来自跨多种模态传感器阵列的信息。在波束成形与语音增强等任务上训练和测试信号处理及机器学习算法需要高质量的具代表性数据。据作者所知,截至发表时,尚无包含噪声环境中动态运动与对话的同步自我中心多通道音频与视频的可用数据集。本工作中,我们描述、评估并发布了一个包含超过 5 小时多模态数据的数据集,可用于训练和测试改善 AR 眼镜佩戴者对话的应用算法。我们给出了一种基线方法的语音可懂度、质量与信噪比改善结果,并显示所有测试指标均有提升。我们发布的数据集包含 AR 眼镜自我中心多通道麦克风阵列音频、宽视场 RGB 视频、语音源位姿、头戴式麦克风音频、标注的语音活动、语音转写、头部边界框、说话目标与源识别标签。我们创建并发布该数据集,以促进面向鸡尾酒会问题的多模态 AR 解决方案研究。
引用
@article{arxiv.2107.04174,
title = {EasyCom: An Augmented Reality Dataset to Support Algorithms for Easy Communication in Noisy Environments},
author = {Jacob Donley and Vladimir Tourbabin and Jung-Suk Lee and Mark Broyles and Hao Jiang and Jie Shen and Maja Pantic and Vamsi Krishna Ithapu and Ravish Mehra},
journal= {arXiv preprint arXiv:2107.04174},
year = {2021}
}
备注
Dataset is available at: https://github.com/facebookresearch/EasyComDataset