中文

面向片段级与帧级任务的自监督音频师生 Transformer

音频与语音处理 2023-11-08 v2 机器学习

摘要

自监督学习(SSL)已成为学习音频表征的一种流行方法。音频自监督预训练的一个目标是将知识迁移到下游音频任务,通常包括片段级和帧级任务。虽然帧级任务对于细粒度声学场景/事件理解十分重要,但先前的研究主要在片段级下游任务上进行评估。为了同时处理片段级和帧级任务,本文提出音频师生 Transformer(ATST),包含片段级版本(称为 ATST-Clip)和帧级版本(称为 ATST-Frame),分别负责学习片段级和帧级表征。两种方法均使用 Transformer 编码器和师生训练方案。我们为 ATST-Clip 和 ATST-Frame 精心设计了视图创建策略。具体而言,ATST-Clip 使用分段数据增强,ATST-Frame 集成了帧级数据增强与掩码。实验结果表明,我们的 ATST-Frame 模型在大多数片段级和帧级下游任务上取得了最先进(SOTA)性能。特别是在帧级声音事件检测任务上,它以较大优势优于其他模型。此外,通过知识蒸馏结合两个模型可进一步提升性能。我们的代码已在线公开。

关键词

引用

@article{arxiv.2306.04186,
  title  = {Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks},
  author = {Xian Li and Nian Shao and Xiaofei Li},
  journal= {arXiv preprint arXiv:2306.04186},
  year   = {2023}
}

备注

Submitted to IEEE TASLP. arXiv admin note: text overlap with arXiv:2204.12076