CI-AVSR:用于车载指令识别的粤语视听语音数据集
计算与语言
2022-03-15 v2 人工智能
摘要
随着深度学习和智能车辆的兴起,智能助手已成为促进驾驶和提供额外功能的必备车载组件。车载智能助手应能够处理通用及与车辆相关的指令并执行相应动作,从而简化驾驶并提升安全性。然而,低资源语言存在数据稀缺问题,阻碍了研究与应用的开展。本文介绍一个新数据集——粤语车载视听语音识别(CI-AVSR),用于粤语车载指令识别,包含视频和音频数据。其由30名粤语母语者录制的200条车载指令的4,984个样本(8.3小时)组成。此外,我们使用常见车载背景噪声扩充数据集以模拟真实环境,生成比采集数据集大10倍的数据集。我们提供了干净版和扩充版数据集的详细统计信息。而且,我们实现了两个多模态基线以证明CI-AVSR的有效性。实验结果表明,利用视觉信号改善了模型的整体性能。尽管我们的最佳模型在干净测试集上能取得可观的质量,但在噪声数据上的语音识别质量仍较差,对于真实车载语音识别系统而言仍是一项极具挑战的任务。数据集与代码将于https://github.com/HLTCHKUST/CI-AVSR发布。
引用
@article{arxiv.2201.03804,
title = {CI-AVSR: A Cantonese Audio-Visual Speech Dataset for In-car Command Recognition},
author = {Wenliang Dai and Samuel Cahyawijaya and Tiezheng Yu and Elham J. Barezi and Peng Xu and Cheuk Tung Shadow Yiu and Rita Frieske and Holy Lovenia and Genta Indra Winata and Qifeng Chen and Xiaojuan Ma and Bertram E. Shi and Pascale Fung},
journal= {arXiv preprint arXiv:2201.03804},
year = {2022}
}
备注
6 pages