回放它:用于音频识别的迭代注意力
声音
2023-03-14 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
听觉认知的一项关键功能是将特征性声音与其对应语义随时间关联起来。试图区分细粒度音频类别的人,常会重放相同的判别性声音以提高其预测置信度。我们提出一种基于注意力的端到端架构,它通过选择性重复来关注音频序列中最具判别性的声音。我们的模型初始使用完整音频序列,并基于槽注意力(slot attention)迭代地精炼所重放的时间段。在每次回放时,所选段落以更小的跳长(hop length)重放,代表这些段落内更高分辨率的特征。我们表明,我们的方法能在三个音频分类基准上持续取得最先进(state-of-the-art)性能:AudioSet、VGG-Sound 和 EPIC-KITCHENS-100。
引用
@article{arxiv.2210.11328,
title = {Play It Back: Iterative Attention for Audio Recognition},
author = {Alexandros Stergiou and Dima Damen},
journal= {arXiv preprint arXiv:2210.11328},
year = {2023}
}
备注
Accepted at IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2023