中文

基于多模态融合与深度学习的笑声识别系统的设计与开发

声音 2024-08-01 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

本研究旨在设计与实现一个基于多模态融合与深度学习的笑声识别系统,利用图像与音频处理技术实现准确的笑声识别与情感分析。首先,系统加载视频文件,使用 OpenCV 库提取面部信息,同时采用 Librosa 库处理 MFCC 等音频特征。然后,利用多模态融合技术整合图像与音频特征,再通过深度学习模型进行训练与预测。评估结果表明,该模型在测试数据集上取得了 80% 的准确率、精确率和召回率,F1 分数为 80%,展现出稳健的性能和处理真实数据变异性的能力。本研究不仅验证了多模态融合方法在笑声识别中的有效性,也突出了其在情感计算和人机交互中的潜在应用。未来工作将聚焦于进一步优化特征提取与模型架构以提高识别准确率,并拓展应用场景,推动笑声识别技术在心理健康监测和教育活动评估等领域的应用。

关键词

引用

@article{arxiv.2407.21391,
  title  = {Design and Development of Laughter Recognition System Based on Multimodal Fusion and Deep Learning},
  author = {Fuzheng Zhao and Yu Bai},
  journal= {arXiv preprint arXiv:2407.21391},
  year   = {2024}
}

备注

7 pages,2 figures