归一化过程中丢失了什么?探讨多语言ASR模型评估中的常见陷阱
计算与语言
2024-11-12 v4 人工智能
人机交互
摘要
本文探讨了评估多语言自动语音识别(ASR)模型时存在的常见陷阱,特别关注印度语言脚本。我们研究了领先ASR模型所采用的文本归一化程序,包括OpenAI Whisper、Meta的MMS、Seamless以及Assembly AI的Conformer,以及这些程序对性能指标所产生的意外后果。我们的研究表明,当前的文本归一化实践虽然旨在标准化ASR输出以便于公平比较,但通过消除拼写、标点和特殊字符等不一致性,却在印度脚本上存在根本性缺陷。通过使用文本相似度得分和深入的语言学检验,我们演示了这些缺陷导致印度语言的性能指标被人为地改善。我们通过提出一种利用本土语言学专业知识开发的文本归一化程序,以确保对多语言ASR模型进行更稳健和准确的评估,来结束本文。
引用
@article{arxiv.2409.02449,
title = {What is lost in Normalization? Exploring Pitfalls in Multilingual ASR Model Evaluations},
author = {Kavya Manohar and Leena G Pillai and Elizabeth Sherly},
journal= {arXiv preprint arXiv:2409.02449},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main