中文

TI-ASU:通过文本到语音插补实现鲁棒的自动语音理解以应对语音模态缺失

量子物理 2024-04-30 v1

摘要

自动语音理解 (ASU) 旨在实现类人的语音理解,从语音及其包含的文本内容中提供细微的意图、情感、情绪和内容理解。通常,训练一个鲁棒的 ASU 模型严重依赖于大规模、高质量的语音及相应文本转录。然而,由于隐私等问题,收集或使用语音数据来训练 ASU 通常具有挑战性。为了应对这种语音(音频)模态缺失的情况,我们提出了 TI-ASU,使用预训练的文本到语音模型来插补缺失的语音。我们报告了在各种缺失比例、单模态和多模态设置以及使用 LLM 的情况下进行的广泛实验评估。我们的研究结果表明,即使在高达 95% 的语音数据缺失的情况下,TI-ASU 也能显著提高 ASU 的性能。此外,我们表明 TI-ASU 对插补具有适应性,提高了模型在推理时处理缺失语音的鲁棒性。

关键词

引用

@article{arxiv.2404.17982,
  title  = {XGSwap: eXtreme Gradient boosting Swap for Routing in NISQ Devices},
  author = {Jean-Baptiste Waring and Christophe Pere and Sébastien Le Beux},
  journal= {arXiv preprint arXiv:2404.17982},
  year   = {2024}
}

备注

7 pages, 11 figures, 3 tables. Submitted to QCE24