基于变分自编码器的声学环境聚类用于听力设备
音频与语音处理
2026-01-22 v3
摘要
传统的声学环境分类依赖:i) 经典信号处理算法,无法提取高维数据的有意义表示;或 ii) 监督学习,受限于标签的可用性。鉴于人类施加的标签并不总能反映声音场景的真实结构,我们探索了使用变分自编码器(VAE)进行(无监督)声学环境聚类的潜力。我们采用一种带 Gumbel-Softmax 参数化的 VAE 模型进行分类型潜在聚类,可采用时间上下文窗口方案以降低内存需求,针对实际听力设备场景进行优化。此外,还提出了针对音频聚类的 VAE 架构的通用改进。通过对 spoken digits 的聚类(标签具有意义,任务较简单)以及城市声景的聚类(录制文件在时频上存在强烈重叠)进行验证,所有变分方法在 spoken digits 聚类中均取得成功成果,但仅提出的模型在城市声学场景中实现了有效聚类,得益于其分类型特征。
引用
@article{arxiv.2510.01940,
title = {Clustering of Acoustic Environments with Variational Autoencoders for Hearing Devices},
author = {Luan Vinícius Fiorio and Ivana Nikoloska and Wim van Houtum and Ronald M. Aarts},
journal= {arXiv preprint arXiv:2510.01940},
year = {2026}
}