inaGVAD:用于语音活动检测和说话人性别分割的法国电视和广播语料库
音频与语音处理
2024-06-10 v1 数字图书馆
多媒体
声音
摘要
inaGVAD 是一个从 10 个法国广播电台和 18 个电视台收集的音频语料库,分为 4 组:通用广播、音乐广播、新闻电视和通用电视。它包含 277 份时长为 1 分钟的标注录音,旨在代表法国视听节目在声学上的多样性,主要设计用于构建能够监测男性和女性说话时间的系统。inaGVAD 提供了语音活动检测(VAD)和说话人性别分割(SGS)的标注,扩展了重叠情况、说话人特征(性别、年龄、语音质量)以及 10 类非语音事件类别。详细阐述了每个频道类别的标注分布。该数据集分为 1 小时的开发子集和 3 小时 37 分钟的测试子集,允许公平且可重复的系统评估。 presented a benchmark of 6 个免费可用的 VAD 软件,显示了根据频道类别和非语音事件类别所表现出的差异。对 2 个现有的 SGS 系统在该语料库上的评估,并与基于开发子集训练的基线 X-vector 迁移学习策略进行比较。结果表明,我们的方案在仅使用单一——但具有多样性的——1 小时数据训练后,达到了竞争性的 SGS 结果。整个 inaGVAD 包;包括语料库、标注、评估脚本和基线训练代码;均 freely accessible,促进了该领域的未来发展。
引用
@article{arxiv.2406.04429,
title = {InaGVAD : a Challenging French TV and Radio Corpus Annotated for Speech Activity Detection and Speaker Gender Segmentation},
author = {David Doukhan and Christine Maertens and William Le Personnic and Ludovic Speroni and Reda Dehak},
journal= {arXiv preprint arXiv:2406.04429},
year = {2024}
}
备注
Voice Activity Detection (VAD), Speaker Gender Segmentation, Audiovisual Speech Resource, Speaker Traits, Speech Overlap, Benchmark, X-vector, Gender Representation in the Media, Dataset