中文

VoxKnesset:面向老化说话人建模的大规模纵向希伯来语语音数据集

音频与语音处理 2026-03-06 v2 计算与语言 机器学习 声音 信号处理

摘要

语音处理系统面临一个根本性挑战:人类语音会随年龄变化,而鲜有数据集支持严格的纵向评估。我们介绍 VoxKnesset,这是一个覆盖 2009-2025 年、约 2,300 小时希伯来语议会语音的数据集,包含 393 位说话人,录音跨度可达 15 年。每个语段均包含对齐转录文本和来自官方议会记录的已验证人口学元数据。我们对现代语音嵌入(WavLM-Large、ECAPA-TDNN、Wav2Vec2-XLSR-1B)在纵向条件下的年龄预测和说话人验证进行基准测试。结果显示,对于最强模型,说话人验证 EER 在 15 年间从 2.15% 上升至 4.58%;而横截面训练的年龄回归模型未能捕捉说话人老化的变化,纵向训练模型却恢复了有意义的时序信号。我们公开释放数据集和处理管道,以支持老化鲁棒语音系统和希伯来语语音处理。

关键词

引用

@article{arxiv.2603.01270,
  title  = {VoxKnesset: A Large-Scale Longitudinal Hebrew Speech Dataset for Aging Speaker Modeling},
  author = {Yanir Marmor and Arad Zulti and David Krongauz and Adam Gabet and Yoad Snapir and Yair Lifshitz and Eran Segal},
  journal= {arXiv preprint arXiv:2603.01270},
  year   = {2026}
}

备注

4 pages, 5 figures, 2 tables