中文

2021 年 NIST 说话人识别评测

音频与语音处理 2022-04-22 v1 机器学习 声音 图像与视频处理

摘要

2021 年说话人识别评测(SRE21)是美国国家标准与技术研究院(NIST)自 1996 年以来持续开展的评测系列的最新一轮。它是 NIST 组织的第二次大规模多模态说话人/人员识别评测(第一次为 SRE19)。与 SRE19 类似,它包含音频和音视频两个核心评测轨道,以及一个可选的视觉轨道。除了提供固定和开放训练条件外,得益于由语言数据联盟(LDC)在北美以外收集的称为 WeCanTalk 的新多模态(即音频、视频和自拍图像)和多语言(即含多语言说话人)语料库,它也为学界带来了新挑战。这些挑战包括:1) 注册与测试片段来自不同域(即电话语音 versus 视频)的试验(目标与非目标);以及 2) 注册与测试片段以不同语言说出的试验(即跨语言试验)。本文概述 SRE21,包括任务、性能度量、数据、评测协议、结果及系统性能分析。来自学术界与工业界的共 23 家机构(组成 15 支队伍)参与了 SRE21 并提交 158 份有效系统输出。评测结果表明:音视频融合相较仅音频或仅视觉系统带来显著性能提升;在本评测匹配的域条件下,顶尖说话人与人脸识别系统表现出相当的性能;并且,复杂神经网络架构(如 ResNet)结合带间隔的角度损失、数据增强以及长时长微调,为仅音频说话人识别任务带来了明显的性能改进。

关键词

引用

@article{arxiv.2204.10242,
  title  = {The 2021 NIST Speaker Recognition Evaluation},
  author = {Seyed Omid Sadjadi and Craig Greenberg and Elliot Singer and Lisa Mason and Douglas Reynolds},
  journal= {arXiv preprint arXiv:2204.10242},
  year   = {2022}
}