面向年龄与性别识别的 VoxCeleb 数据增强
机器学习
2021-12-21 v2 计算与语言
声音
音频与语音处理
摘要
VoxCeleb 数据集广泛用于说话人识别研究。我们的工作有两个目的。首先,我们提供说话人年龄标签以及(另一种)说话人性别标注。其次,我们通过构建具有不同特征与分类器的年龄和性别识别模型来展示该元数据的用途。我们查询不同的名人数据库并应用一致性规则来推导年龄与性别标签。我们还将原始 VoxCeleb 性别标签与我们的标签进行比较,以识别原始 VoxCeleb 数据中可能误标记录。在建模方面,我们设计了一项关于多种特征与模型用于识别性别和年龄的综合研究。我们的最佳系统使用 i-vector 特征,在性别识别任务中采用逻辑回归取得了 0.9829 的 F1 分数,而年龄回归中最低平均绝对误差(MAE)9.443 年由岭回归获得。这表明从野外风格语音数据进行年龄估计具有挑战性。
引用
@article{arxiv.2109.13510,
title = {VoxCeleb Enrichment for Age and Gender Recognition},
author = {Khaled Hechmi and Trung Ngo Trong and Ville Hautamaki and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2109.13510},
year = {2021}
}
备注
Accepted for presentation at ASRU 2021; repository: https://github.com/hechmik/voxceleb_enrichment_age_gender