中文

JiTTER:用于自监督声音事件检测的事件重建拼图时间 Transformer

音频与语音处理 2025-03-03 v1 声音

摘要

声音事件检测(SED)已显著受益于自监督学习(SSL)方法,特别是用于 SED 的掩码音频 Transformer (MAT-SED),它利用掩码块预测来重建缺失的音频片段。然而,尽管掩码块预测在捕获全局依赖方面很有效,但它会破坏瞬态声音事件且缺乏对时间顺序的显式强制,使其不太适用于细粒度事件边界检测。为了解决这些局限性,我们提出了 JiTTER(用于事件重建的拼图时间 Transformer),这是一个旨在增强基于 Transformer 的 SED 中时间建模的 SSL 框架。JiTTER 引入了一种分层时间混洗重建策略,其中音频序列在块级和帧级均被随机混洗,迫使模型重建正确的时间顺序。这种预训练目标鼓励模型学习全局事件结构和细粒度瞬态细节,从而提高其检测具有尖锐起止特征事件的能力。此外,我们在块混洗过程中加入了噪声注入,提供了一种微妙的扰动机制,进一步正则化特征学习并增强模型鲁棒性。在 DESED 数据集上的实验结果表明,JiTTER 优于 MAT-SED,PSDS 提高了 5.89%,突显了显式时间推理在基于 SSL 的 SED 中的有效性。我们的发现表明,结构化时间重建任务而非简单的掩码预测,为声音事件表示学习提供了一种更有效的预训练范式。

关键词

引用

@article{arxiv.2502.20857,
  title  = {JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection},
  author = {Hyeonuk Nam and Yong-Hwa Park},
  journal= {arXiv preprint arXiv:2502.20857},
  year   = {2025}
}