中文

提升Singlish理解水平:数据集与多模态模型的桥梁

计算与语言 2025-01-14 v2 声音 音频与语音处理

摘要

Singlish是一种以英语为根基的混合语,在多语言和多文化语境中是语言学研究的关键焦点。然而,其语音形式仍未得到充分探索,限制了对其语言结构及应用的深入见解。为此,我们标准化并标注了最大的 spoken Singlish语料库,引入了多任务全国语音语料库(MNSC)。这些数据集支持包括自动语音识别(ASR)、口语问答(SQA)、口语对话摘要(SDS)和语音要素问答(PQA)在内的多种任务。我们发布了标准化的划分方案和经人工验证的测试集,以便进一步研究。此外,我们提出了SingAudioLLM,一个基于多模态大型语言模型的多任务模型,用于同时处理这些任务。实验结果显示,我们的模型在Singlish语境下表现出良好的适应性,实现了最先进的性能,相较于其他AudioLLMs和级联解决方案,在多个指标上提升了10-30%。

关键词

引用

@article{arxiv.2501.01034,
  title  = {Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models},
  author = {Bin Wang and Xunlong Zou and Shuo Sun and Wenyu Zhang and Yingxu He and Zhuohan Liu and Chengwei Wei and Nancy F. Chen and AiTi Aw},
  journal= {arXiv preprint arXiv:2501.01034},
  year   = {2025}
}

备注

Open-Source: https://github.com/AudioLLMs/Singlish