中文

基于Blinky的声学事件分类自编码器预训练

音频与语音处理 2025-09-22 v1 声音

摘要

在采用Blinkies的声学事件分类 (AEC) 框架中,音频信号被转换为LED光信号,随后通过单个视频摄像头捕获。然而,30 fps的光传输信道仅约传达正常音频带宽的0.2%,且高度易受噪声影响。我们提出了一种新颖的声音到光转换方法,利用预训练自编码器 (AE) 的编码器从记录的音频中提取紧凑、判别性特征。为预训练AE,我们采用噪声鲁棒学习策略,在编码器的潜在表示期间注入人工噪声,从而增强模型对信道噪声的鲁棒性。编码器架构专为当代边缘设备(如树莓派4)的内存占用而设计。在ESC-50数据集上进行严格的15 Hz带宽约束下的仿真实验中,所提出的方法在宏观F1分数方面优于传统的声音到光转换方法。

关键词

引用

@article{arxiv.2509.15261,
  title  = {Pre-training Autoencoder for Acoustic Event Classification via Blinky},
  author = {Xiaoyang Liu and Yuma Kinoshita},
  journal= {arXiv preprint arXiv:2509.15261},
  year   = {2025}
}

备注

Accepted to APSIPA ASC 2025. 6 pages, 1 figures