一种创建大规模性别和年龄平衡说话人语料库的半自动方法:说话人日志与识别的效用
音频与语音处理
2024-04-29 v1 计算与语言
数字图书馆
机器学习
声音
摘要
本文提出了一种半自动方法,用于创建按说话人年龄、性别和录音时期平衡的历时语音语料库,分为32个类别(2个性别、4个年龄段和4个录音时期)。语料库选自法国国家视听研究所(INA),每个类别至少30个说话人(总共960个说话人;目前仅找到874个)。对于每个说话人,使用自动流水线从视听文档中提取语音片段,该流水线包括语音检测、背景音乐和重叠语音去除以及说话人日志,用于向人工标注者呈现干净的说话人片段以识别目标说话人。该流水线被证明非常有效,将手动处理减少了十倍。提供了自动处理质量和最终输出的评估。结果表明,自动处理与最新流程相当,并且输出为大多数选定片段提供了高质量语音。该方法在创建大规模已知目标说话人语料库方面显示出前景。
引用
@article{arxiv.2404.17552,
title = {A Semi-Automatic Approach to Create Large Gender- and Age-Balanced Speaker Corpora: Usefulness of Speaker Diarization & Identification},
author = {Rémi Uro and David Doukhan and Albert Rilliard and Laëtitia Larcher and Anissa-Claire Adgharouamane and Marie Tahon and Antoine Laurent},
journal= {arXiv preprint arXiv:2404.17552},
year = {2024}
}
备注
Keywords:, semi-automatic processing, corpus creation, diarization, speaker identification, gender-balanced, age-balanced, speaker corpus, diachrony