OLR 2021 挑战赛:数据集、规则与基线
计算与语言
2021-07-26 v1 机器学习
声音
音频与语音处理
摘要
本文介绍了第六届东方语种识别 (OLR) 2021 挑战赛,旨在提高多语言场景下的语种识别系统和语音识别系统的性能。本文介绍了数据概况、四个任务、两个基线以及评估原则。除了语种识别 (LID) 任务外,多语言自动语音识别 (ASR) 任务首次被引入 OLR 2021 挑战赛。今年的挑战赛聚焦于更实用且更具挑战性的问题,包含四个任务:(1) 限定 LID,(2) 非限定 LID,(3) 限定多语言 ASR,(4) 非限定多语言 ASR。分别为 LID 任务和多语言 ASR 任务提供了基线。LID 基线系统是用 Pytorch 构建的扩展 TDNN x-vector 模型。提供了一个基于 Transformer 的端到端模型作为多语言 ASR 基线系统。这些方案将在线发布,供参赛者构建自己的 LID 或 ASR 系统。基线结果表明,这些任务相当具有挑战性,值得投入更多努力以获得更好的性能。
引用
@article{arxiv.2107.11113,
title = {OLR 2021 Challenge: Datasets, Rules and Baselines},
author = {Binling Wang and Wenxuan Hu and Jing Li and Yiming Zhi and Zheng Li and Qingyang Hong and Lin Li and Dong Wang and Liming Song and Cheng Yang},
journal= {arXiv preprint arXiv:2107.11113},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2006.03473, arXiv:1907.07626, arXiv:1806.00616, arXiv:1706.09742