解读预训练模型是优化模型架构的关键:以 Wav2Vec 2.0 为例
计算与语言
2021-04-08 v1
摘要
评估指标良好的深度 Transformer 模型并不意味着每个子网络(即 transformer block)都学到了合理的表示。诊断并避免异常表示有助于获得更好的评估指标。我们提出了一种分析注意力模式的创新视角:总结块级模式并假设异常模式会带来负面影响。我们以 Wav2Vec 2.0 为研究对象,分析预训练模型中的模式。所有实验均使用 Librispeech-100-clean 作为训练数据。通过避免已诊断出的异常模式,我们定制的 Wav2Vec 2.0 在使用 viterbi 解码时,于 test-clean 上的绝对词错误率(WER)比原始版本高出约 4.8%。在使用 4-gram 语言模型解码时,我们的版本仍优于原始版本 0.9%。此外,我们确认避免异常模式是性能提升的主要贡献因素。
引用
@article{arxiv.2104.02851,
title = {Interpreting A Pre-trained Model Is A Key For Model Architecture Optimization: A Case Study On Wav2Vec 2.0},
author = {Liu Chen and Meysam Asgari},
journal= {arXiv preprint arXiv:2104.02851},
year = {2021}
}