CV-18 NER:用于阿拉伯语语音命名实体识别的增强常见语音
计算与语言
2026-04-03 v1
摘要
端到端语音命名实体识别(NER)旨在直接从语音中提取实体。先前的工作表明,端到端(E2E)方法在英语、法语和中文上优于级联管道,但阿拉伯语由于其形态复杂性、缺乏短元音以及有限的标注资源,仍未得到充分探索。我们介绍CV-18 NER,首个面向阿拉伯语语音NER的公开数据集,通过在阿拉伯语常见语音18语料库上进行手动NER标注,遵循细粒度的Wojood模式(21种实体类型)。我们对比了管道系统(ASR + 文本NER)和基于Whisper和AraBEST-RQ的E2E模型。E2E系统在测试集上显著优于最佳管道配置,分别达到37.0%的CoER(AraBEST-RQ 300M)和38.0%的CVER(Whisper-medium)。进一步分析表明,阿拉伯语特定的自监督预训练在语音识别中效果良好,而多语言弱监督学习在联合语音到实体学习中转移更有效,较大模型在这一低资源环境下可能更难适应。我们的数据集和模型已公开发布,提供了阿拉伯语语音端到端命名实体识别的首个开放基准测试 https://huggingface.co/datasets/Elyadata/CV18-NER。
引用
@article{arxiv.2604.02209,
title = {CV-18 NER: Augmented Common Voice for Named Entity Recognition from Arabic Speech},
author = {Youssef Saidi and Haroun Elleuch and Fethi Bougares},
journal= {arXiv preprint arXiv:2604.02209},
year = {2026}
}
备注
Accepted at OSACT 2026