中文

Spatial HuBERT:基于多通道音频的单说话人自监督空间语音表征学习

计算与语言 2023-10-18 v1 声音 音频与语音处理

摘要

自监督学习已被用于利用无标注数据,通过表征模型的训练来提升语音系统的准确率与泛化能力。尽管近期许多工作致力于在多种声学域、语言、模态乃至同时说话人场景下产生有效表征,这些研究均局限于单通道音频记录。本文提出 Spatial HuBERT,一种自监督语音表征模型,其利用多通道音频输入,学习在潜在噪声环境中关于单一说话人的声学与空间信息。Spatial HuBERT 学到的表征在多种空间下游任务上优于最先进的单通道语音表征,尤其在混响与噪声环境中。我们还展示了 Spatial HuBERT 所学表征在语音定位下游任务上的效用。随本文一并公开发布了一个包含 100 000 条模拟一阶 ambisonics 房间脉冲响应的新数据集。

关键词

引用

@article{arxiv.2310.10922,
  title  = {Spatial HuBERT: Self-supervised Spatial Speech Representation Learning for a Single Talker from Multi-channel Audio},
  author = {Antoni Dimitriadis and Siqi Pan and Vidhyasaharan Sethu and Beena Ahmed},
  journal= {arXiv preprint arXiv:2310.10922},
  year   = {2023}
}