中文

SGEM:基于序列级广义熵最小化的自动语音识别测试时自适应方法

音频与语音处理 2023-06-22 v4 人工智能 机器学习

摘要

自动语音识别(ASR)模型在诸多真实场景下面临数据分布偏移,导致预测错误。为应对此问题,已有一种测试时自适应(TTA)方法被提出,可在无源数据情况下于未标注测试样本上自适应预训练ASR模型。尽管取得了不错的性能提升,该工作仅依赖朴素贪婪解码,并在帧级别跨时间步进行自适应,鉴于模型输出的序列特性,这可能并非最优。受此启发,我们提出了一种新颖的TTA框架,称为SGEM,适用于通用ASR模型。为处理序列输出,SGEM首先利用集束搜索探索候选输出logits并选择最合理的一个;随后,它使用广义熵最小化与负采样作为无监督目标来自适应模型。SGEM在各种域偏移下对三种主流ASR模型均取得了最先进的性能。

关键词

引用

@article{arxiv.2306.01981,
  title  = {SGEM: Test-Time Adaptation for Automatic Speech Recognition via Sequential-Level Generalized Entropy Minimization},
  author = {Changhun Kim and Joonhyung Park and Hajin Shim and Eunho Yang},
  journal= {arXiv preprint arXiv:2306.01981},
  year   = {2023}
}

备注

INTERSPEECH 2023 Oral Presentation; Code is available at https://github.com/drumpt/SGEM