中文

M&M:用于认知负荷评估的多模态-多任务模型集成音视频线索

计算机视觉与模式识别 2024-03-15 v1 多媒体 声音 音频与语音处理

摘要

本文介绍了M&M模型,这是一个应用于AVCAffe数据集进行认知负荷评估(CLA)的新型多模态-多任务学习框架。M&M模型独特地通过双路径架构集成音视频线索, featuring 专门用于音频和视频输入的 specialized 流。其关键创新在于其跨模态多头注意力机制,实现对不同模态的融合以进行同步多任务处理。另一个值得注意的特性是该模型拥有三个 specialized 分支,每个分支针对特定的认知负荷标签进行设计,实现细粒度、任务特定的分析。虽然在性能上略逊于AVCAffe的单任务基线,但M&M模型展示了一个集成多模态处理的有前景的框架。本工作为未来在多模态-多任务学习系统中进行的改进铺平了道路,强调融合多样化数据以处理复杂任务。

关键词

引用

@article{arxiv.2403.09451,
  title  = {M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment},
  author = {Long Nguyen-Phuoc and Renald Gaboriau and Dimitri Delacroix and Laurent Navarro},
  journal= {arXiv preprint arXiv:2403.09451},
  year   = {2024}
}