中文

TokenVerse: 基于转换器的语音与 NLP 任务统一方法

计算与语言 2024-10-10 v2 声音 音频与语音处理

摘要

在传统语音交互中,采用级联流程处理语音,包括声音活动检测、说话人分割、转录以及针对语义端点检测和命名实体识别 (NER) 等任务的不同 NLP 模型。本文引入 TokenVerse,一个单一的转换器模型,用于处理多个任务。通过在 ASR 模型训练期间将任务特定标记整合到参考文本中,实现推理简化,无需单独的 NLP 模型。除了 ASR 任务外,我们还在 3 项不同任务上进行实验:说话人变化检测、端点检测和 NER。在公开数据集和私有数据集上的实验表明,所提方法在相对 WER 上提高了最高 7.7%,并在单项任务性能上优于级联管道方法。我们的代码已公开:https://github.com/idiap/tokenverse-unifying-speech-nlp

关键词

引用

@article{arxiv.2407.04444,
  title  = {TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR},
  author = {Shashi Kumar and Srikanth Madikeri and Juan Zuluaga-Gomez and Iuliia Thorbecke and Esaú Villatoro-Tello and Sergio Burdisso and Petr Motlicek and Karthik Pandia and Aravind Ganapathiraju},
  journal= {arXiv preprint arXiv:2407.04444},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 (Main Conference)