3D-Speaker-Toolkit:一个用于多模态说话人验证和说话人日志的开源工具包
音频与语音处理
2024-12-30 v3 信号处理
摘要
我们介绍了3D-Speaker-Toolkit,这是一个用于多模态说话人验证和说话人日志的开源工具包,旨在满足学术研究人员和工业从业者的需求。3D-Speaker-Toolkit巧妙地利用了声学、语义和视觉数据的综合优势,无缝融合这些模态以提供强大的说话人识别能力。声学模块从声学特征中提取说话人嵌入,采用全监督和自监督学习方法。语义模块利用先进的语言模型来理解口语的内容和上下文,从而通过语言模式增强系统区分说话人的能力。视觉模块应用图像处理技术来仔细检查面部特征,这提高了多说话人环境中说话人日志的精度。这些模块共同使3D-Speaker-Toolkit能够在与说话人相关的任务中实现显著提高的准确性和可靠性。通过3D-Speaker-Toolkit,我们为多模态说话人分析建立了一个新的基准。该工具包还包含一系列开源的最先进模型和一个包含超过10,000名说话人的大规模数据集。该工具包在https://github.com/modelscope/3D-Speaker上公开可用。
引用
@article{arxiv.2403.19971,
title = {3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization},
author = {Yafeng Chen and Siqi Zheng and Hui Wang and Luyao Cheng and Tinglong Zhu and Rongjie Huang and Chong Deng and Qian Chen and Shiliang Zhang and Wen Wang and Xihao Li},
journal= {arXiv preprint arXiv:2403.19971},
year = {2024}
}