面向低资源 ASR 的多语言多模态模型参数高效适配
计算与语言
2024-10-18 v1 人工智能
机器学习
音频与语音处理
摘要
面向低资源语言的自动语音识别(ASR)由于标注训练数据的稀缺性仍然是一个挑战。参数高效微调和文本-only 适配是两种常用于解决此类低资源场景的方法。本文研究了如何有效地将这些技术与诸如 SeamlessM4T 之类的多语言多模态模型相结合。多模态模型能够通过文本-only 适配获取未标注文本,从而实现参数高效的 ASR 微调,从而提升 ASR 性能。我们还展示了从高资源语言进行的跨语言迁移,在无任何标注语音的零样本设置下即可实现约 17% 的词错误率(WER)降低。
引用
@article{arxiv.2410.13445,
title = {Parameter-efficient Adaptation of Multilingual Multimodal Models for Low-resource ASR},
author = {Abhishek Gupta and Amruta Parulekar and Sameep Chattopadhyay and Preethi Jyothi},
journal= {arXiv preprint arXiv:2410.13445},
year = {2024}
}