TaigiSpeech:低资源真实语境语意数据集及基于大规模野外数据挖掘的初步结果
计算与语言
2026-03-24 v1 机器学习
音频与语音处理
摘要
语音技术正在快速发展,服务于全球各地人群。然而,许多语言因资源匮乏而处于边缘地位。本文介绍TaigiSpeech,一个来自台湾台语(亦称台湾闽南语/南部闽语)的真实语境语意数据集,该语言属于低资源且主要为口语语言。数据集由老年人组成,包含21位说话人,总计3000余句语音。其设计旨在用于实际的语意检测场景,包括医疗和智能家居应用。为解决标签数据稀缺的问题,我们探索了两种数据挖掘策略,分别基于不同监督程度:关键词匹配数据挖掘通过中间语言的LLM伪标签生成,以及一种利用多模态线索并仅依赖最小文本监督的音视频框架。这种设计使我们能够为低资源和未编纂的口语语言构建可扩展的数据集。TaigiSpeech将在CC BY 4.0许可下发布,以促进其在低资源和未编纂语言研究中的广泛采用。项目网站和数据集可在https://kwchang.org/taigispeech找到。
关键词
引用
@article{arxiv.2603.21478,
title = {TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild},
author = {Kai-Wei Chang and Yi-Cheng Lin and Huang-Cheng Chou and Wenze Ren and Yu-Han Huang and Yun-Shao Tsai and Chien-Cheng Chen and Yu Tsao and Yuan-Fu Liao and Shrikanth Narayanan and James Glass and Hung-yi Lee},
journal= {arXiv preprint arXiv:2603.21478},
year = {2026}
}
备注
submitted to Interspeech 2026