面向高效音频表示学习的人启发式解耦架构
声音
2026-03-30 v1 人工智能
机器学习
摘要
虽然自监督学习(SSL)革新了音频表示,但标准Transformer的过度参数化和二次计算成本限制了其在资源受限设备上的部署。为解决这一瓶颈,我们提出HEAR(Human-inspired Efficient Audio Representation),一种新颖的解耦架构。借鉴人类从全局上下文中隔离局部声学特征的认知能力,HEAR将处理流水线拆分为两个专用模块:用于局部特征提取的声学模型和用于全局语义整合的任务模型。结合通过知识蒸馏训练的声学标记器,我们的方法实现了鲁棒的掩码音频建模(MAM)。广泛的实验表明,HEAR仅需15M参数和9.47 GFLOPs进行推理,计算成本仅为传统基础模型(通常需要85M–94M参数)的极小部分。尽管效率极高,HEAR在多样化的音频分类基准测试中仍取得了极具竞争力的性能。代码和预训练模型可在https://github.com/HarunoriKawano/HEAR获取。
引用
@article{arxiv.2603.26098,
title = {A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning},
author = {Harunori Kawano and Takeshi Sasaki},
journal= {arXiv preprint arXiv:2603.26098},
year = {2026}
}