MoLAN:面向多模态情感分析的统一模态感知噪声动态编辑框架
机器学习
2026-01-19 v2 计算与语言
计算机视觉与模式识别
摘要
多模态情感分析旨在整合音频、视觉和文本等various 模态的信息,以做出互补预测。然而,它往往难以处理无关或误导性的视觉和听觉信息。大多数现有方法将整个模态信息(如整幅图像、音频段或文本段落)视为独立单元进行特征增强或去噪,可能在抑制冗余和噪声信息的同时风险丢失关键信息。为此,我们提出 MoLAN,一种统一的 ModaLity-aware 噪声 dynAmic editing 框架。具体而言,MoLAN 通过将每个模态的特征划分为多个块来实现模态感知的阻塞式处理。每个块根据其噪声水平和语义相关性动态分配不同的去噪强度,从而在抑制噪声的同时保留关键的多模态信息。值得注意的是,MoLAN 是一个统一且灵活的框架,可无缝集成到各种多模态模型中。基于此框架,我们进一步引入 MoLAN+,一种新的多模态情感分析方法。在五个模型和四个数据集上的实验表明,MoLAN 框架具有广泛有效性。广泛的评估显示,MoLAN+ 实现了最新水平的性能。该代码已公开于 https://github.com/betterfly123/MoLAN-Framework。
关键词
引用
@article{arxiv.2508.09145,
title = {MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis},
author = {Xingle Xu and Yongkang Liu and Dexian Cai and Shi Feng and Xiaocui Yang and Daling Wang and Yifei Zhang},
journal= {arXiv preprint arXiv:2508.09145},
year = {2026}
}