中文

1SPU:一步语音处理单元

音频与语音处理 2023-12-12 v3

摘要

近期研究通过应用连接时序分类(CTC)损失来增强转写中的命名实体识别,从而在精炼端到端(E2E)语音识别编码器方面取得了一些进展。然而,这些方法受限于仅使用ASCII字符集,只允许有限的语义标签阵列。我们提出1SPU,一种一步语音处理单元(1-step Speech Processing Unit),其可在转写语音内容的同时识别语音事件(如说话人变更)或自然语言事件(意图、情感)。它通过添加一组未使用的占位符号扩展了E2E自动语音识别(ASR)系统的词表,概念上类似于序列建模中使用的<pad>令牌。这些占位符随后被指定用于表示语义事件(以标签形式),并作为独立令牌整合进转写过程。我们在SLUE基准上展示了显著提升,并取得了与SLURP数据集相当的结果。此外,我们对系统随时间准确锁定有意义令牌的能力进行了可视化分析,说明了利用附加语义标签带来的转写质量增强。

关键词

引用

@article{arxiv.2311.04753,
  title  = {1SPU: 1-step Speech Processing Unit},
  author = {Karan Singla and Shahab Jalalvand and Yeon-Jun Kim and Antonio Moreno Daniel and Srinivas Bangalore and Andrej Ljolje and Ben Stern},
  journal= {arXiv preprint arXiv:2311.04753},
  year   = {2023}
}

备注

Accepted at International Conference on Natural Language Processing 2023