中文

Synthia的旋律:一种用于音频无监督域适应的基准框架

声音 2023-09-27 v1 机器学习 音频与语音处理

摘要

尽管视觉与自然语言深度学习取得重大进展,音频中的无监督域适应仍相对未被充分探索。我们部分将此归因于缺乏合适的基准数据集。为填补这一空白,我们提出Synthia's melody,一种新颖的音频数据生成框架,能够模拟无限多样的4秒旋律,其用户指定的混淆结构由音乐调性、音色与响度刻画。与在观测环境下收集的现状数据集不同,Synthia's melody不含未观测偏置,确保实验的可复现性与可比性。为展示其效用,我们生成了两类分布偏移——域偏移与样本选择偏置——并评估声学深度学习模型在这些偏移下的表现。我们的评估揭示,Synthia's melody为考察这些模型对不同程度分布偏移的敏感性提供了稳健的测试平台。

关键词

引用

@article{arxiv.2309.15024,
  title  = {Synthia's Melody: A Benchmark Framework for Unsupervised Domain Adaptation in Audio},
  author = {Chia-Hsin Lin and Charles Jones and Björn W. Schuller and Harry Coppock},
  journal= {arXiv preprint arXiv:2309.15024},
  year   = {2023}
}