大规模多模态人类语音识别数据集
信号处理
2023-03-16 v1 声音
音频与语音处理
摘要
如今,非隐私小规模运动检测在语音识别遥感中吸引了越来越多研究。这些新模态被用于增强并从多类型数据的说话者处恢复语音信息。本文提出一个数据集,包含来自超宽带(UWB)雷达的7.5 GHz信道冲激响应(CIR)数据、来自毫米波(mmWave)雷达的77-GHz调频连续波(FMCW)数据以及激光数据。同时,采用深度相机记录受试者唇部与语音的标记点。提供了约400分钟标注语音档案,采集自20名参与者发出的5个元音、15个词与16个句子。该数据集已通过验证,在唇读与多模态语音识别研究中具有潜力。
引用
@article{arxiv.2303.08295,
title = {A large-scale multimodal dataset of human speech recognition},
author = {Yao Ge and Chong Tang and Haobo Li and Zikang Zhang and Wenda Li and Kevin Chetty and Daniele Faccio and Qammer H. Abbasi and Muhammad Imran},
journal= {arXiv preprint arXiv:2303.08295},
year = {2023}
}