ATST:基于师生 Transformer 的音频表征学习
音频与语音处理
2023-06-08 v3 人工智能
声音
摘要
自监督学习(SSL)从大量无标注数据中学习知识,然后将知识迁移到标注数据有限的特定问题。SSL 已在多个领域取得可喜结果。本工作针对片段级通用音频 SSL 问题,提出一种基于 transformer 的师生 SSL 新模型,名为 ATST。在近期出现的师生基线方案上开发了 transformer 编码器,大幅提升了预训练的建模能力。此外,设计了一种新的正样本对构建策略,以充分利用 transformer 的能力。我们进行了大量实验,所提模型在几乎所有下游任务上均取得了新的 SOTA 结果。
引用
@article{arxiv.2204.12076,
title = {ATST: Audio Representation Learning with Teacher-Student Transformer},
author = {Xian Li and Xiaofei Li},
journal= {arXiv preprint arXiv:2204.12076},
year = {2023}
}
备注
INTERSPEECH2022(Accepted)