中文

HLT-NUS 参加 NIST 2019 多媒体说话人识别评测的系统

音频与语音处理 2020-10-09 v1 声音

摘要

本文描述了新加坡国立大学人类语言技术实验室(HLT-NUS)为 2019 NIST 多媒体说话人识别评测(SRE)开发的说话人确认系统。多媒体研究已引起广泛关注,说话人识别也不例外。与往届 NIST SRE 不同,本届评测聚焦于多媒体赛道,利用音频和视觉信息进行说话人识别。我们分别针对音频和视觉输入开发了独立的系统,随后对两种模态的系统进行分数级融合以综合利用其信息。音频系统基于 x-vector 说话人嵌入,而人脸识别系统基于 ResNet 和 InsightFace 的人脸嵌入。通过评测后的研究与改进,我们在 2019 NIST 多媒体 SRE 语料库的评测集上获得了 0.88% 的等错误率(EER)和 0.026 的实际检测代价函数。

关键词

引用

@article{arxiv.2010.03905,
  title  = {HLT-NUS Submission for NIST 2019 Multimedia Speaker Recognition Evaluation},
  author = {Rohan Kumar Das and Ruijie Tao and Jichen Yang and Wei Rao and Cheng Yu and Haizhou Li},
  journal= {arXiv preprint arXiv:2010.03905},
  year   = {2020}
}

备注

Accepted for publication in APSIPA ASC 2020