面向语音的PEFT:揭示最优放置、合并策略与集成技术
计算与语言
2024-02-08 v2 声音
音频与语音处理
摘要
参数高效微调(PEFT)在语音处理中日益被视为一种有效方法。然而,PEFT方法的最优策略及其放置位置尚无定论。我们的研究进行了广泛实验,采用可微架构搜索(DARTS)比较了不同的PEFT方法及其逐层放置策略。我们还探索了利用集成学习来整合多样化的PEFT策略。结果表明,DARTS并未优于基线方法,后者将相同的PEFT方法插入自监督学习(SSL)模型的所有层。相比之下,集成学习方法(尤其是采用多数投票的方法)表现出更优的性能。我们的统计证据表明,不同的PEFT方法以不同方式进行学习。这种差异或许可以解释为何通过集成学习对各种PEFT方法进行协同整合,能够比单独的逐层优化更有效地发挥其独特的学习能力。
引用
@article{arxiv.2401.02122,
title = {PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques},
author = {Tzu-Han Lin and How-Shing Wang and Hao-Yung Weng and Kuang-Chen Peng and Zih-Ching Chen and Hung-yi Lee},
journal= {arXiv preprint arXiv:2401.02122},
year = {2024}
}
备注
Accepted to ICASSP 2024 Self-supervision in Audio, Speech and Beyond (SASB) workshop