面向低成本的端到端口语理解
计算与语言
2022-07-04 v1 声音
音频与语音处理
摘要
口语理解的最新进展受益于在大型语音语料库上训练的自监督(Self-Supervised, SSL)模型。对于法语,LeBenchmark 项目已提供此类模型,并在包括口语理解在内的若干任务上取得了令人瞩目的进展。这些进展在计算时间和能耗方面具有不可忽略的代价。在本文中,我们比较了几种试图降低此类代价同时保持有竞争力性能的学习策略。同时,我们提出一项广泛的分析,在其中衡量我们模型在训练时间和电能消耗方面的代价,以期推动一种全面的评估流程。实验在 FSC 和 MEDIA 语料库上进行,并表明在使用 SSL 模型的同时降低学习代价而维持最先进(state-of-the-art, SOTA)性能是可能的。
引用
@article{arxiv.2207.00352,
title = {Toward Low-Cost End-to-End Spoken Language Understanding},
author = {Marco Dinarelli and Marco Naguib and François Portet},
journal= {arXiv preprint arXiv:2207.00352},
year = {2022}
}
备注
Accepted for publication at Interspeech 2022; Slightly improved (longer) version