探究 Faetar ASR 基准中的转录归一化
计算与语言
2025-08-21 v2
摘要
我们检查了转录不一致性在 Faetar 自动语音识别基准中的作用,这是一个具有挑战性的低资源 ASR 基准。通过帮助一个小型的人工构建词典,我们得出结论,尽管转录中确实存在不一致性,但它们并不是该任务的主要挑战。我们还演示了大二元词基于语言模型并没有额外的好处,但将解码限制在有限词典内是有益的。该任务仍然极其困难。
引用
@article{arxiv.2508.11771,
title = {Investigating Transcription Normalization in the Faetar ASR Benchmark},
author = {Leo Peckham and Michael Ong and Naomi Nagy and Ewan Dunbar},
journal= {arXiv preprint arXiv:2508.11771},
year = {2025}
}