开发语码转换多语言数据集与评估指标:聚焦香港多语动态
声音
2025-03-04 v4 计算与语言
音频与语音处理
摘要
现有音频数据集主要面向单一语言,忽视了从事语码转换的多语言社区的复杂语言行为。这种个人在日常交流中频繁混合两种或更多语言的做法,在中国香港等多语言地区尤为普遍。为弥补这一空白,我们利用多智能体数据生成框架(MADGF)开发了 34.8 小时的粤英混合(MCE)音频数据集。我们使用 MCE 数据集微调了开源多语言自动语音识别(ASR)模型 Whisper,取得了令人惊艳的零样本性能。传统指标忽视了实际应用中的延迟以及语码转换场景等重要因素。我们提出了一种称为保真度、准确率与延迟(FAL)的新评估指标。该指标旨在克服用于评估 ASR 系统的传统指标的局限性。
引用
@article{arxiv.2310.17953,
title = {Developing a Multilingual Dataset and Evaluation Metrics for Code-Switching: A Focus on Hong Kong's Polylingual Dynamics},
author = {Peng Xie and Kani Chen},
journal= {arXiv preprint arXiv:2310.17953},
year = {2025}
}