中文

基于联邦学习的分布式 IoT 网络中无监督说话人分割

声音 2024-12-02 v2 机器学习 音频与语音处理

摘要

本文提出了一个计算高效且分布式的 speaker diarization 框架,用于 networked IoT 风格的音频设备. 工作提出一个 Federated Learning 模型,可在不要求大型音频数据库进行训练的情况下识别对话中的参与者. 提出一种 novel 的无监督在线更新机制用于 Federated Learning 模型,该机制依赖于说话人嵌入的余弦相似性. 此外,提出的 diarization 系统解决 speaker change 检测问题,通过无监督分割技术使用 Hotelling's t-squared 统计量和贝叶斯信息准则. 在这种新方法中,speaker change 检测围绕检测到的准确静音区域偏置,这减少了 missed detection 与 false detection 率之间的严重 trade-off. 此外,由于逐帧识别说话人的计算开销,通过无监督聚类 speech segments 来减少. 结果表明,所提出的训练方法在 non-IID speech data 中有效. 同时,它在减少 false 和 missed detection 方面显著提高了分割阶段的准确性,同时降低了计算开销. 提高的准确性和降低的计算成本使该机制适用于分布式 IoT 音频网络中的实时 speaker diarization.

关键词

引用

@article{arxiv.2404.10842,
  title  = {Unsupervised Speaker Diarization in Distributed IoT Networks Using Federated Learning},
  author = {Amit Kumar Bhuyan and Hrishikesh Dutta and Subir Biswas},
  journal= {arXiv preprint arXiv:2404.10842},
  year   = {2024}
}

备注

11 pages, 7 figures, 1 table