中文

PromptASR:具备可控风格的上下文感知ASR

音频与语音处理 2024-01-25 v3 计算与语言 声音

摘要

提示对大语言模型至关重要,因为它们提供主题或逻辑关系等上下文信息。受此启发,我们提出PromptASR,一个在端到端自动语音识别(E2E ASR)系统中集成提示以实现具备可控转录风格的上下文感知ASR的框架。具体而言,一个专用的文本编码器对文本提示进行编码,并通过跨注意力机制将两种模态的特征编码注入语音编码器。当使用前文话语的真实文本作为内容提示时,与基线ASR系统相比,所提系统在书籍朗读数据集和内部数据集上分别实现了21.9%和6.8%的相对词错误率降低。该系统还可将词级偏置列表作为提示,以提高对罕见词的识别准确率。可向文本编码器提供额外的风格提示,引导ASR系统输出不同风格的转录文本。代码见icefall。

关键词

引用

@article{arxiv.2309.07414,
  title  = {PromptASR for contextualized ASR with controllable style},
  author = {Xiaoyu Yang and Wei Kang and Zengwei Yao and Yifan Yang and Liyong Guo and Fangjun Kuang and Long Lin and Daniel Povey},
  journal= {arXiv preprint arXiv:2309.07414},
  year   = {2024}
}

备注

Proc. ICASSP 2024