中文

SUPERB:语音处理通用性能基准

计算与语言 2021-10-19 v4 声音 音频与语音处理

摘要

自监督学习(SSL)已被证明对推进自然语言处理(NLP)与计算机视觉(CV)的研究至关重要。该范式在大量无标注数据上预训练一个共享模型,并以最小适配在各类任务上达到最先进(SOTA)水平。然而,语音处理领域缺乏类似的设定来系统性地探索该范式。为弥补此差距,我们引入语音处理通用性能基准(Speech processing Universal PERformance Benchmark, SUPERB)。SUPERB 是一个排行榜,用于在最小架构改动与标注数据下,跨广泛语音处理任务基准测试共享模型的性能。在共享模型的多种用途中,我们尤其关注提取从 SSL 学到的表示,因其具有更佳的复用性。我们提出一个简单框架,通过在冻结的共享模型之上学习任务专用的轻量级预测头来解决 SUPERB 任务。我们的结果表明该框架大有前景,因为 SSL 表示在 SUPERB 任务间展现出有竞争力的泛化性与可及性。我们发布 SUPERB 作为一个含排行榜与基准工具包的挑战赛,以推动表示学习与通用语音处理的研究。

关键词

引用

@article{arxiv.2105.01051,
  title  = {SUPERB: Speech processing Universal PERformance Benchmark},
  author = {Shu-wen Yang and Po-Han Chi and Yung-Sung Chuang and Cheng-I Jeff Lai and Kushal Lakhotia and Yist Y. Lin and Andy T. Liu and Jiatong Shi and Xuankai Chang and Guan-Ting Lin and Tzu-Hsien Huang and Wei-Cheng Tseng and Ko-tik Lee and Da-Rong Liu and Zili Huang and Shuyan Dong and Shang-Wen Li and Shinji Watanabe and Abdelrahman Mohamed and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2105.01051},
  year   = {2021}
}

备注

To appear in Interspeech 2021