中文

将自监督语音模型与来自视觉基础语音模型的伪词级目标相集成

音频与语音处理 2024-02-09 v1 计算与语言 机器学习

摘要

自监督语音模型的最新进展在许多下游任务中展现出显著提升。然而,这些模型主要集中于帧级训练目标,在需要语义理解的口语理解任务中可能存在不足。现有工作通常依赖额外的语音-文本数据作为中间目标,这在真实场景中成本高昂。为应对这一挑战,我们提出了 Pseudo-Word HuBERT (PW-HuBERT),这是一个将伪词级目标整合到训练过程中的框架,其中目标派生自视觉基础语音模型,显著消除了对语音-文本配对数据的需求。我们在四个口语理解 (SLU) 基准上的实验结果表明了我们的模型在捕获语义信息方面的优越性。

关键词

引用

@article{arxiv.2402.05819,
  title  = {Integrating Self-supervised Speech Model with Pseudo Word-level Targets from Visually-grounded Speech Model},
  author = {Hung-Chieh Fang and Nai-Xuan Ye and Yi-Jen Shih and Puyuan Peng and Hsuan-Fu Wang and Layne Berry and Hung-yi Lee and David Harwath},
  journal= {arXiv preprint arXiv:2402.05819},
  year   = {2024}
}

备注

Accepted to ICASSP 2024 workshop on Self-supervision in Audio, Speech, and Beyond (SASB)