中文

基于变分自编码器的声学环境聚类用于听力设备

音频与语音处理 2026-01-22 v3

摘要

传统的声学环境分类依赖:i) 经典信号处理算法,无法提取高维数据的有意义表示;或 ii) 监督学习,受限于标签的可用性。鉴于人类施加的标签并不总能反映声音场景的真实结构,我们探索了使用变分自编码器(VAE)进行(无监督)声学环境聚类的潜力。我们采用一种带 Gumbel-Softmax 参数化的 VAE 模型进行分类型潜在聚类,可采用时间上下文窗口方案以降低内存需求,针对实际听力设备场景进行优化。此外,还提出了针对音频聚类的 VAE 架构的通用改进。通过对 spoken digits 的聚类(标签具有意义,任务较简单)以及城市声景的聚类(录制文件在时频上存在强烈重叠)进行验证,所有变分方法在 spoken digits 聚类中均取得成功成果,但仅提出的模型在城市声学场景中实现了有效聚类,得益于其分类型特征。

关键词

引用

@article{arxiv.2510.01940,
  title  = {Clustering of Acoustic Environments with Variational Autoencoders for Hearing Devices},
  author = {Luan Vinícius Fiorio and Ivana Nikoloska and Wim van Houtum and Ronald M. Aarts},
  journal= {arXiv preprint arXiv:2510.01940},
  year   = {2026}
}