面向低资源任务的选择性注意力合并:儿童ASR案例研究
计算与语言
2025-01-16 v1 声音
音频与语音处理
摘要
虽然语音基础模型(SFM)在各种语音任务中表现出色,但其在低资源任务(如儿童自动语音识别,ASR)上的性能受限于预训练数据的有限性。为此,我们探索了不同的模型合并技术,以利用在更大规模、更丰富语音语料库上训练的模型的知识。本文还引入了选择性注意力(SA)合并,这是一种新方法,通过选择性合并注意力矩阵中的任务向量来提高SFM在低资源任务上的性能。针对MyST数据库进行的实验表明,采用SA合并可显著降低相对词错误率(WER),最高可达14%,优于现有的模型合并和数据增强技术。通过将数据增强技术与SA合并结合,我们在MyST数据库上实现了Whisper-small模型的新的状态最佳WER为8.69,凸显了SA合并提高低资源ASR潜力的可能性。
引用
@article{arxiv.2501.08468,
title = {Selective Attention Merging for low resource tasks: A case study of Child ASR},
author = {Natarajan Balaji Shankar and Zilai Wang and Eray Eren and Abeer Alwan},
journal= {arXiv preprint arXiv:2501.08468},
year = {2025}
}
备注
To appear in ICASSP 2025