中文

InfantCryNet:用于智能分析婴儿啼哭的数据驱动框架

声音 2025-02-05 v2 人工智能 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

理解婴儿啼哭的含义是年轻父母照顾新生儿时面临的重要挑战。背景噪声的存在以及缺乏标记数据,为开发能够检测啼哭并分析其背后原因的系统带来了实际挑战。本文提出一种新颖的数据驱动框架,InfantCryNet,以完成上述任务。为解决数据稀缺问题,我们采用预训练的音频模型以整合先验知识。我们提出运用统计池化和多头注意力池化技术更有效地提取特征。此外,还应用知识蒸馏和模型量化以提升模型效率,减小模型规模,更好地支持在移动设备上的工业部署。实验在真实场景数据集上表明,所提框架的性能显著优于最先进的基准方法,分类准确率提升 4.4%。模型压缩有效地在不影响性能的情况下将模型规模缩小 7%,或在仅降低 8% 准确率的情况下将模型规模缩小最高 28%,为模型选择与系统设计提供了实际见解。

关键词

引用

@article{arxiv.2409.19689,
  title  = {InfantCryNet: A Data-driven Framework for Intelligent Analysis of Infant Cries},
  author = {Mengze Hong and Chen Jason Zhang and Lingxiao Yang and Yuanfeng Song and Di Jiang},
  journal= {arXiv preprint arXiv:2409.19689},
  year   = {2025}
}

备注

Accepted by the 16th Asian Conference on Machine Learning (ACML 2024)