中文

PIER:评估代码切换中关键问题的新指标

计算与语言 2025-01-22 v2 机器学习

摘要

代码切换,即在单个话语中交替使用语言,为自动语音识别带来了重大挑战。尽管任务特性独特,但通常使用诸如词错误率(WER)等 established 指标来衡量性能。在本文中,我们质疑这些通用指标是否准确评估代码切换性能。具体而言,我们使用 Connectionist-Temporal-Classification 和 Encoder-Decoder 模型,显示在来自 matrix 和 embedded 语言的非代码切换数据上进行的 fine-tuning 虽然改善了代码切换测试集上的经典指标,但实际的代码切换词汇反而恶化(如预期)。因此,我们提出了基于感兴趣词汇错误率(PIER)的指标,这是 WER 的一种变体,仅关注特定感兴趣词汇。我们在代码切换话语上实现了 PIER,表明这更准确地描述了代码切换性能,显示在未来工作中存在巨大的改进空间。这种聚焦评估允许对模型性能进行更精确的评估,尤其是在 inter-word 和 intra-word 代码切换方面。

关键词

引用

@article{arxiv.2501.09512,
  title  = {PIER: A Novel Metric for Evaluating What Matters in Code-Switching},
  author = {Enes Yavuz Ugan and Ngoc-Quan Pham and Leonard Bärmann and Alex Waibel},
  journal= {arXiv preprint arXiv:2501.09512},
  year   = {2025}
}

备注

Accepted at ICASSP 2025