估计人声 i-vector 表示的唯一性
音频与语音处理
2021-03-04 v2 声音
摘要
我们针对广泛使用的语音话语特征表示即 i-vector 模型,研究人声的个体差异性。作为实现该目标的第一步,我们比较并对比了为不同生物识别模态提出的唯一性度量。随后,我们引入一种新的唯一性度量,在考虑说话人层面变化的同时评估 i-vector 的熵。我们的度量在离散特征空间中操作,并依赖于对 i-vector 分布的准确估计。因此,在对 i-vector 进行量化时,确保量化表示与原始表示产生相似的说话人验证性能。唯一性估计来自两个新生成的数据集以及公开的 VoxCeleb 数据集。第一个自定义数据集包含从 TEDx Talks 视频中获得的 20,741 名说话人的超过一百五十万条语音样本。第二个数据集包含从电影对白中提取的 1,595 名演员的超过两万一千条语音样本。利用这些数据,我们分析了说话人数量、每位说话人的样本数、样本时长和话语多样性等若干因素如何影响唯一性估计。最值得注意的是,我们确定 i-vector 的离散化不会导致说话人识别性能下降。我们的结果表明,考虑 5 秒长语音样本时,基于 i-vector 的表示所提供的区分度可达 43–70 比特;然而,在受限较少的语音变化下,唯一性估计减少约 30 比特。我们还发现,将样本时长加倍可使 i-vector 表示的区分度提高约 20 比特。
引用
@article{arxiv.2008.11985,
title = {Estimating Uniqueness of I-Vector Representation of Human Voice},
author = {Erkam Sinan Tandogan and Husrev Taha Sencar},
journal= {arXiv preprint arXiv:2008.11985},
year = {2021}
}
备注
13 pages