中文

SITA:面向低资源声调语言的学习讲者不变性和语调感知语音表示

计算与语言 2026-01-15 v1

摘要

声调低资源语言虽广泛分布,却在现代语音技术中被严重忽视。关键挑战在于学习鲁棒的表征,能够抵御性别等 nuisance 变异,同时保持对不同词义的语调敏感性。为此,我们提出SITA(Speaker-Invariant and Tone-Aware),一种轻量级适配方案,用于预训练的wav2vec风格编码器。SITA采用分阶段多目标训练:(i)跨性别对比目标鼓励跨说话者的词汇一致性,同时语调排斥损失通过显式分离相同词语中不同语调的实现来防止语调坍缩;(ii)基于CTC的辅助ASR目标与知识蒸馏相结合,以稳定识别相关结构。我们主要在高度声调且资源极度匮乏的Hmong语言上进行评估,此处处于离线多语言编码器无法有效表征语调。实验表明,在精选的Hmong词语语料库上,SITA显著提升了跨性别词汇检索准确率,同时保持可用的ASR准确率,相较于基于ASR适配的XLS-R教师模型。我们进一步观察到,将相同配方迁移至普通话(Mandarin)也能获得类似提升,表明SITA是一种通用、可插拔式方法,适用于将多语言语音编码器适配到声调语言。

关键词

引用

@article{arxiv.2601.09050,
  title  = {SITA: Learning Speaker-Invariant and Tone-Aware Speech Representations for Low-Resource Tonal Languages},
  author = {Tianyi Xu and Xuan Ouyang and Binwei Yao and Shoua Xiong and Sara Misurelli and Maichou Lor and Junjie Hu},
  journal= {arXiv preprint arXiv:2601.09050},
  year   = {2026}
}

备注

8 pages (excluding references, limitations, ethics, acknowledgement, and appendix); 4 figures in the main paper; appendix included