中文

面向对话印尼语音的 Pyannote 说话人识别管线领域适应

声音 2026-01-08 v1

摘要

本研究提出一种针对对话印尼语语音的说话人识别管线领域适应方法。我们针对低资源语言,采用基于神经文本转语音技术的合成数据生成,以适配以英语为中心的说话人识别管线。实验采用不同训练配置,分别使用小型数据集(171个样本)和包含25小时合成语音的大型数据集。结果表明,基线模型 \texttt{pyannote/segmentation-3.0} 在印尼语上零样本应用时,达到53.47\% 的说话人识别错误率(DIE)。领域适应显著提升了性能,小型数据集模型分别在1个和2个训练周期内将错误率降至34.31\%和34.81\%。在25小时数据集上训练的模型取得最佳表现,错误率为29.24\%,相对于基线实现了13.68\%的绝对提升,同时保持99.06\%的召回率和87.14\%的F1分数。

关键词

引用

@article{arxiv.2601.03684,
  title  = {Domain Adaptation of the Pyannote Diarization Pipeline for Conversational Indonesian Audio},
  author = {Muhammad Daffa'i Rafi Prasetyo and Ramadhan Andika Putra and Zaidan Naufal Ilmi and Kurniawati Azizah},
  journal= {arXiv preprint arXiv:2601.03684},
  year   = {2026}
}

备注

Experiments conducted using synthetic Indonesian conversational speech for domain adaptation