基于模拟对话的数据高效儿童-成人说话人日志化
音频与语音处理
2025-06-13 v1
摘要
自动化儿童语音分析对于神经认知评估等应用至关重要。说话人日志化,即识别“谁在何时说话”,是自动化分析的一个基本组成部分。然而,由于隐私问题和缺乏标注数据集,公开可用的儿童-成人说话人日志化解决方案十分稀缺,而为每个场景手动标注数据既耗时又昂贵。为了克服这些挑战,我们提出了一种数据高效的解决方案,通过使用AudioSet创建模拟的儿童-成人对话。然后,我们训练了一个基于Whisper编码器的模型,在使用真实数据集进行儿童-成人说话人日志化时取得了强大的零样本性能。当仅用30分钟的真实训练数据进行微调时,模型性能显著提高,而LoRA进一步提升了迁移学习性能。源代码和在模拟对话上训练的儿童-成人说话人日志化模型已公开可用。
引用
@article{arxiv.2409.08881,
title = {Data Efficient Child-Adult Speaker Diarization with Simulated Conversations},
author = {Anfeng Xu and Tiantian Feng and Helen Tager-Flusberg and Catherine Lord and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2409.08881},
year = {2025}
}
备注
Under review