中文

基于深度可分离卷积自编码器网络的音频家庭活动聚类

音频与语音处理 2022-08-05 v1 声音

摘要

从音频中自动估计家庭活动可用于解决诸多问题,例如降低照护老年人的人力成本。本研究聚焦于解决从音频中进行家庭活动聚类的问题。家庭活动聚类的目标是以无监督方式将属于同一类家庭活动的音频片段聚为一簇。本文提出一种使用深度可分离卷积自编码器网络的家庭活动聚类方法。在所提方法中,初始嵌入由深度可分离卷积自编码器学习,并设计面向聚类的损失以联合优化嵌入精炼与簇分配。在2018年Detection and Classification of Acoustic Scenes and Events (DCASE)挑战赛使用的公共数据集(SINS数据集的衍生)上评估不同方法。我们的方法取得归一化互信息(NMI)分数54.46%和聚类准确率(CA)分数63.64%,并在NMI和CA上优于最先进方法。此外,我们方法的计算复杂度和内存需求均低于先前基于深度模型的方法。代码:https://github.com/vinceasvp/domestic-activity-clustering-from-audio

关键词

引用

@article{arxiv.2208.02406,
  title  = {Domestic Activity Clustering from Audio via Depthwise Separable Convolutional Autoencoder Network},
  author = {Yanxiong Li and Wenchang Cao and Konstantinos Drossos and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2208.02406},
  year   = {2022}
}

备注

6 pages, 5 figures, 4 tables. Accepted by IEEE MMSP 2022