Dynamic-SUPERB:面向动态、协作且全面的语音指令微调基准
音频与语音处理
2024-03-25 v2 机器学习
声音
摘要
文本语言模型在提供表述良好的指令时,已展现出泛化至未见任务的显著零样本能力。然而,现有语音处理研究主要聚焦于有限或特定任务。此外,缺乏标准化基准阻碍了不同方法间的公平比较。因此,我们提出 Dynamic-SUPERB,一个旨在构建通用语音模型的基准,该模型能够利用指令微调以零样本方式执行多种任务。为实现对多样化语音任务的全面覆盖并借助指令微调,我们邀请社区协作贡献,促进基准的动态增长。作为起步,Dynamic-SUPERB 通过组合 33 个任务与 22 个数据集,具备 55 个评估实例。这涵盖了广泛的维度,提供了一个全面的评估平台。此外,我们提出了若干建立基准基线的方法,包括利用语音模型、文本语言模型以及多模态编码器。评估结果表明,尽管这些基线在已见任务上表现合理,但在未见任务上表现不佳。我们向公众发布所有材料,并欢迎研究人员协作该项目,共同推动该领域技术发展。
引用
@article{arxiv.2309.09510,
title = {Dynamic-SUPERB: Towards A Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark for Speech},
author = {Chien-yu Huang and Ke-Han Lu and Shih-Heng Wang and Chi-Yuan Hsiao and Chun-Yi Kuan and Haibin Wu and Siddhant Arora and Kai-Wei Chang and Jiatong Shi and Yifan Peng and Roshan Sharma and Shinji Watanabe and Bhiksha Ramakrishnan and Shady Shehata and Hung-yi Lee},
journal= {arXiv preprint arXiv:2309.09510},
year = {2024}
}
备注
To appear in the proceedings of ICASSP 2024