中文

场景语音: 基于扩散模型的声学场景转换以实现沉浸式语音生成

计算与语言 2024-06-19 v1

摘要

本文引入了语音处理中一种新任务——声学场景转换 (Acoustic Scene Transfer, AST),旨在将语音信号的声学场景转移到多样化的环境中。AST 有望在语音感知中提供沉浸式体验,通过将语音信号背后的声学场景适配到所需的环境。我们提出了 AST-LDM 用于 AST 任务,生成伴随参考提示目标声学场景的语音信号。具体而言,AST-LDM 是一种以 CLAP 嵌入为条件的潜在扩散模型,后者描述目标声学场景的音频或文本模态。本文的贡献包括引入 AST 任务并实现其基线模型。对于 AST-LDM,我们强调其核心框架,即保持输入语音并使生成的音频与给定语音和目标声学环境保持一致。包括客观测试和主观测试的实验验证了我们方法的可行性和有效性。

关键词

引用

@article{arxiv.2406.12687,
  title  = {Using LLMs to Aid Annotation and Collection of Clinically-Enriched Data in Bipolar Disorder and Schizophrenia},
  author = {Ankit Aich and Avery Quynh and Pamela Osseyi and Amy Pinkham and Philip Harvey and Brenda Curtis and Colin Depp and Natalie Parde},
  journal= {arXiv preprint arXiv:2406.12687},
  year   = {2024}
}