中文

语言不匹配对基于深度学习嵌入的自动法庭话者比对的影响

声音 2023-04-12 v1 计算与语言 音频与语音处理

摘要

在法庭话者比对中,话者嵌入在过去 10 年已广受欢迎。大多数预训练话者嵌入是在英语语料库上训练的,因其易获取。因此,语言依赖性可成为自动法庭话者比对中的重要因素,尤其当目标语言在语言学上差异很大时。现有众多商用系统,但其模型主要训练于不同于目标语言的语言(多为英语)。对于低资源语言,构建含足够话者以训练深度学习模型的法庭用途语料库成本高昂。本研究旨在探究在英语语料库上预训练的模型能否用于不同于训练语言的目标低资源语言(此处为匈牙利语)。此外,通常无法从 offender(未知话者)获取多个样本。因此,对有嫌疑(已知)话者进行有/无话者注册的成对样本比对。采用了两个专为法庭目的开发的语料库与第三个面向传统话者验证的语料库。使用两种基于深度学习的话者嵌入向量提取方法:x-vector 与 ECAPA-TDNN。话者验证在似然比框架下评估。对语言组合(建模、LR 校准、评估)进行比较。结果由 minCllr 与 EER 指标评价。发现于不同语言但含海量话者的语料库上预训练的模型在语言不匹配样本上表现良好。亦考察了样本时长与说话风格的影响。发现样本时长越长性能越好。且应用不同说话风格无实质差异。

关键词

引用

@article{arxiv.2209.12602,
  title  = {Effects of language mismatch in automatic forensic voice comparison using deep learning embeddings},
  author = {Dávid Sztahó and Attila Fejes},
  journal= {arXiv preprint arXiv:2209.12602},
  year   = {2023}
}