中文

DSCLAP:面向语音助手的领域特定对比语言-音频预训练

声音 2024-09-17 v1 多媒体 音频与语音处理

摘要

分析真实世界的多模态信号是智能语音助手(IVA)的一个必需且充满挑战的任务。主流方法通过预训练音频模型和文本模型,在各种IVA下游任务上取得了显著性能。然而,这些模型是在不同于目标领域的任务上独立预训练的,导致下游任务的模态表征次优。此外,在许多领域,收集足够的语言-音频配对极其困难,转录原始音频也需要高度专业技能,这使得联合预训练在难度或甚至在不可行。为解决这些痛点,我们提出了DSCLAP(Domain-Specific Contrastive Language-Audio Pre-Training),一个简单且有效的框架,仅使用原始音频信号输入即可实现语言-音频预训练。具体而言,DSCLAP通过语音识别(ASR)系统将原始音频信号转换为文本,结合对比学习目标和语言-音频匹配目标,对齐音频与ASR转录文本。我们在12,107小时的车载领域音频上预训练DSCLAP。实验结果表明,尽管方法概念简单,但DSCLAP在两个下游任务上的所有指标均显著优于基线模型,为领域特定的IVA应用展现了巨大的潜力。

关键词

引用

@article{arxiv.2409.09289,
  title  = {DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training},
  author = {Shengqiang Liu and Da Liu and Anna Wang and Zhiyu Zhang and Jie Gao and Yali Li},
  journal= {arXiv preprint arXiv:2409.09289},
  year   = {2024}
}