FabuLight-ASD:通过身体语言揭示语音活动
计算机视觉与模式识别
2024-12-10 v2 机器学习
神经与进化计算
声音
音频与语音处理
摘要
在多模态环境中进行主动说话人检测(ASD)对于从视频会议到人机交互等各种应用至关重要。本文介绍 FabuLight-ASD,一个先进的 ASD 模型,通过整合面部、音频和身体姿态信息来增强检测精度和鲁棒性。我们的模型基于现有的 Light-ASD 框架,通过 incorporating 人体姿态数据(表示为骨架图)来实现,而不会增加显著的计算开销。使用 Wilder Active Speaker Detection(WASD)数据集进行测试,该数据集以可靠的面部和身体边界框标注而闻名,展示了 FabuLight-ASD 在实际场景中的有效性。FabuLight-ASD 实现了 94.3% 的总体平均精度(mAP),优于 Light-ASD,其总体 mAP 为 93.7%。身体姿态信息的整合在语音受阻、面部遮挡和人声背景噪声等场景中显示出显著优势,mAP 观察到明显提升。此外,效率分析显示参数数量仅增加了 27.3%,且乘-累加运算最多增加 2.4%,凸显了该模型的高效性和可行性。这些发现验证了通过整合身体姿态数据来增强 ASD 性能的有效性。FabuLight-ASD 的代码和模型权重已在 https://github.com/knowledgetechnologyuhh/FabuLight-ASD 上提供。
引用
@article{arxiv.2411.13674,
title = {FabuLight-ASD: Unveiling Speech Activity via Body Language},
author = {Hugo Carneiro and Stefan Wermter},
journal= {arXiv preprint arXiv:2411.13674},
year = {2024}
}
备注
23 pages, 8 figures, 3 tables, accepted for publication in Neural Computing and Applications