中文

用于将语音信号转换为超声舌成像数据的音频-文本扩散模型

声音 2024-03-13 v2 计算与语言 音频与语音处理

摘要

声学到发音反演(AAI)是将音频转换为发音器官运动(如超声舌成像(UTI)数据)的技术。现有AAI方法的一个问题是仅利用个性化声学信息来推导舌头运动的通用模式,从而限制了生成UTI数据的质量。为解决这一问题,本文提出了一种用于UTI数据生成任务的音频-文本扩散模型。在该模型中,利用wav2vec 2.0编码与舌头运动细节相关的个体固有声学特征,同时利用BERT编码与舌头运动普遍性相关的ASR转录文本。随后,利用扩散模块生成UTI数据。实验结果表明,所提出的扩散模型能够生成具有清晰舌头轮廓的高质量UTI数据,这对于语言学分析和临床评估至关重要。该项目可在网站\footnote{https://yangyudong2020.github.io/wav2uti/}上找到。

关键词

引用

@article{arxiv.2403.05820,
  title  = {An Audio-textual Diffusion Model For Converting Speech Signals Into Ultrasound Tongue Imaging Data},
  author = {Yudong Yang and Rongfeng Su and Xiaokang Liu and Nan Yan and Lan Wang},
  journal= {arXiv preprint arXiv:2403.05820},
  year   = {2024}
}

备注

ICASSP2024 Accept