超越词汇:ASR中非语言发声的有效建模
音频与语音处理
2026-07-02 v1
摘要
现代自动语音识别(ASR)系统擅长转录词汇内容,但常常忽略携带对话和情感信息的非语言发声(NV),例如笑声、呼吸声、咳嗽声和哭声。在ASR中对NV建模具有挑战性,因为NV注释稀疏且高度长尾,呼吸声和笑声等频繁类别主导了哭声和咳嗽声等稀有事件。我们研究了三种以数据为中心的策略来改进低资源NV识别:(1)两阶段课程,首先将所有NV事件映射到一个通用标记,然后针对目标类别进行微调;(2)从高资源事件(如笑声和呼吸声)到稀有事件(如哭声)的标记间迁移;(3)具有类别平衡的语音转换增强。实验表明,可以利用跨发声事件的共享声学结构来改进稀有类别的检测,同时保持词汇ASR质量。
引用
@article{arxiv.2607.01563,
title = {Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR},
author = {Gene Yang and Haibin Wu and Peng Su and Ruizhe Huang and Suwon Shon and Bach Do and Minxue Niu and Zhaoheng Ni and Shang-Wen Li and Florian Metze and Yossi Adi and Ming Sun and Yuzong Liu},
journal= {arXiv preprint arXiv:2607.01563},
year = {2026}
}