中文

开发语码转换多语言数据集与评估指标:聚焦香港多语动态

声音 2025-03-04 v4 计算与语言 音频与语音处理

摘要

现有音频数据集主要面向单一语言,忽视了从事语码转换的多语言社区的复杂语言行为。这种个人在日常交流中频繁混合两种或更多语言的做法,在中国香港等多语言地区尤为普遍。为弥补这一空白,我们利用多智能体数据生成框架(MADGF)开发了 34.8 小时的粤英混合(MCE)音频数据集。我们使用 MCE 数据集微调了开源多语言自动语音识别(ASR)模型 Whisper,取得了令人惊艳的零样本性能。传统指标忽视了实际应用中的延迟以及语码转换场景等重要因素。我们提出了一种称为保真度、准确率与延迟(FAL)的新评估指标。该指标旨在克服用于评估 ASR 系统的传统指标的局限性。

关键词

引用

@article{arxiv.2310.17953,
  title  = {Developing a Multilingual Dataset and Evaluation Metrics for Code-Switching: A Focus on Hong Kong's Polylingual Dynamics},
  author = {Peng Xie and Kani Chen},
  journal= {arXiv preprint arXiv:2310.17953},
  year   = {2025}
}