WhisperNER:统一开放命名实体与语音识别
计算与语言
2025-08-08 v2 机器学习
摘要
将命名实体识别(NER)与自动语音识别(ASR)相结合,可以显著提高转录的准确性和信息量。在本文中,我们介绍了 WhisperNER,这是一种支持联合语音转录和实体识别的新模型。WhisperNER 支持开放类型 NER,能够在推理时识别多样且不断演化的实体。基于开放 NER 研究的最新进展,我们用合成语音样本扩充了一个大型合成数据集。这使我们能够在包含大量具有多样 NER 标签示例的数据上训练 WhisperNER。在训练期间,模型以 NER 标签作为提示,并被优化为输出转录的话语以及相应的标记实体。为了评估 WhisperNER,我们为常用的 NER 基准测试生成了合成语音,并用开放 NER 标签对现有的 ASR 数据集进行了标注。我们的实验表明,无论是在域外开放类型 NER 还是监督微调方面,WhisperNER 均优于自然基线。
引用
@article{arxiv.2409.08107,
title = {WhisperNER: Unified Open Named Entity and Speech Recognition},
author = {Gil Ayache and Menachem Pirchi and Aviv Navon and Aviv Shamsian and Gill Hetz and Joseph Keshet},
journal= {arXiv preprint arXiv:2409.08107},
year = {2025}
}
备注
ASRU 2025, IEEE