面向多模态舞蹈即兴识别的部件注意力网络
计算机视觉与模式识别
2023-10-11 v1 人工智能
声音
音频与语音处理
摘要
舞蹈即兴是艺术领域中的活跃研究课题。由于其独特的动态特性,即兴舞蹈的动作分析可能具有挑战性。数据驱动的舞蹈动作分析,包括识别与生成,通常局限于骨骼数据。然而,其他模态的数据(如音频)可被记录并有益于下游任务。本文探讨了多模态融合方法在舞蹈即兴背景下人体动作识别中的应用与性能。我们提出了一种基于注意力的模型——部件注意力网络(CANet),用于三个层次的多模态融合:1)使用 CANet 进行特征融合;2)使用 CANet 与图卷积网络(GCN)进行模型融合;3)使用投票策略进行后期融合。我们进行了充分的实验,以分析各模态在不同融合方法中的影响,并区分关键的时间或部件特征。我们表明,所提模型优于两种基线方法,展示了其在舞蹈即兴分析中的潜力。
引用
@article{arxiv.2310.05938,
title = {Component attention network for multimodal dance improvisation recognition},
author = {Jia Fu and Jiarui Tan and Wenjie Yin and Sepideh Pashami and Mårten Björkman},
journal= {arXiv preprint arXiv:2310.05938},
year = {2023}
}
备注
Accepted to 25th ACM International Conference on Multimodal Interaction (ICMI 2023)