SwitchLingua:首个大规模多语言与多民族语码转换数据集
计算与语言
2025-06-03 v1 人工智能
摘要
语码转换(CS)是在一次对话或话语中交替使用两种或多种语言,通常受社会语境和说话者身份的影响。这种语言现象给自动语音识别(ASR)系统带来了挑战,这些系统通常为单一语言设计,难以处理多语言输入。全球对多语言应用日益增长的需求,包括语码转换 ASR(CSASR)、文本转语音(CSTTS)和跨语言信息检索(CLIR),突显了现有单语数据集的不足。尽管存在一些语码转换数据集,但大多数局限于同质族群内的双语混合,迫切需要一个类似于计算机视觉中 ImageNet 的大规模、多样化基准。为了弥合这一差距,我们引入了 \textbf{LinguaMaster},一个专门为高效和可扩展的多语言数据合成而设计的多智能体协作框架。利用该框架,我们构建了 \textbf{SwitchLingua},这是首个大规模多语言和多民族语码转换数据集,包括:(1)涵盖 12 种语言的 42 万条 CS 文本样本,以及(2)基于文本数据的超过 80 小时的音频录音,这些录音来自代表 18 个国家/地区和 63 个种族/民族背景的 174 位说话者。该数据集捕获了丰富的语言和文化多样性,为推进多语言和多文化研究提供了基础资源。此外,为了解决现有 ASR 评估指标对语码转换场景缺乏敏感度的问题,我们提出了 \textbf{Semantic-Aware Error Rate (SAER)},一种结合语义信息的新型评估指标,为系统性能提供更准确和具备语境感知的评估。
引用
@article{arxiv.2506.00087,
title = {SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset},
author = {Peng Xie and Xingyuan Liu and Tsz Wai Chan and Yequan Bie and Yangqiu Song and Yang Wang and Hao Chen and Kani Chen},
journal= {arXiv preprint arXiv:2506.00087},
year = {2025}
}