中文

Haha-Pod:基于笑声的非言语说话人验证尝试

音频与语音处理 2023-10-10 v2 声音

摘要

人们广泛认为,可从言语语音中提取用于说话人验证的判别性表示。然而,非言语发声携带多少说话人信息仍是一个谜。本文探索基于最普遍的非言语声音形式——笑声的说话人验证。首先,我们使用半自动流程从开源播客媒体中收集了一个新的 Haha-Pod 数据集。该数据集包含超过 240 名说话人的笑声片段及相应的高质量言语语音。其次,我们提出了一个两阶段师生(2S-TS)框架,以最小化言语与非言语(笑声)信号之间的说话人内嵌入距离。将 Haha-Pod 作为测试集,设计了两组试验(S2L-Eval)通过笑声验证说话人身份。实验结果表明,我们的方法能显著提升 S2L-Eval 测试集的性能,且在 VoxCeleb1 测试集上仅有轻微退化。Haha-Pod 数据集的资源可在 https://github.com/nevermoreLin/HahaPod 获取。

关键词

引用

@article{arxiv.2309.14109,
  title  = {Haha-Pod: An Attempt for Laughter-based Non-Verbal Speaker Verification},
  author = {Yuke Lin and Xiaoyi Qin and Ning Jiang and Guoqing Zhao and Ming Li},
  journal= {arXiv preprint arXiv:2309.14109},
  year   = {2023}
}

备注

accepted by ASRU 2023