TokenVerse: 基于转换器的语音与 NLP 任务统一方法
计算与语言
2024-10-10 v2 声音
音频与语音处理
摘要
在传统语音交互中,采用级联流程处理语音,包括声音活动检测、说话人分割、转录以及针对语义端点检测和命名实体识别 (NER) 等任务的不同 NLP 模型。本文引入 TokenVerse,一个单一的转换器模型,用于处理多个任务。通过在 ASR 模型训练期间将任务特定标记整合到参考文本中,实现推理简化,无需单独的 NLP 模型。除了 ASR 任务外,我们还在 3 项不同任务上进行实验:说话人变化检测、端点检测和 NER。在公开数据集和私有数据集上的实验表明,所提方法在相对 WER 上提高了最高 7.7%,并在单项任务性能上优于级联管道方法。我们的代码已公开:https://github.com/idiap/tokenverse-unifying-speech-nlp
引用
@article{arxiv.2407.04444,
title = {TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR},
author = {Shashi Kumar and Srikanth Madikeri and Juan Zuluaga-Gomez and Iuliia Thorbecke and Esaú Villatoro-Tello and Sergio Burdisso and Petr Motlicek and Karthik Pandia and Aravind Ganapathiraju},
journal= {arXiv preprint arXiv:2407.04444},
year = {2024}
}
备注
Accepted at EMNLP 2024 (Main Conference)