中文

用于口语语言日记化的隐式自监督语言表示

音频与语音处理 2024-07-16 v1 计算与语言 声音

摘要

在语码转换(CS)场景下,使用口语语言日记化(LD)作为预处理系统是必要的。此外,相较于显式框架,隐式框架更受青睐,因为它可轻松适配处理低资源或零资源语言。受说话人日记化(SD)文献启发,本文提出三种基于(1)固定分段、(2)基于变化点分段和(3)端到端(E2E)的框架来执行 LD。使用合成 TTSF-LD 数据集的初步探索表明,以 x-vector 作为隐式语言表示并采用恰当的分析窗长(NN)可达到与显式 LD 相当的性能。使用 E2E 框架取得了 6.386.38 的隐式 LD 最佳性能(以 Jaccard 错误率(JER)衡量)。然而,在实用 Microsoft CS(MSCS)数据集上采用 E2E 框架时,隐式 LD 性能退化为 60.460.4。性能差异主要源于 MSCS 与 TTSF-LD 数据集中第二语言的单语片段时长分布差异。此外,为避免片段平滑,单语片段较短意味着应使用较小的 NN 值。同时,在较小 NN 下,由于声学相似性(同一说话人讲两种语言),x-vector 表示无法捕捉所需的语言判别信息。为此,本研究提出一种自监督隐式语言表示。与 x-vector 表示相比,所提表示相对提升 63.9%63.9\%,使用 E2E 框架取得了 21.821.8 的 JER。

关键词

引用

@article{arxiv.2308.10470,
  title  = {Implicit Self-supervised Language Representation for Spoken Language Diarization},
  author = {Jagabandhu Mishra and S. R. Mahadeva Prasanna},
  journal= {arXiv preprint arXiv:2308.10470},
  year   = {2024}
}

备注

Planning to Submit in IEEE-JSTSP