MSE-Adapter:为大语言模型提供多模态情感分析与情感识别能力的轻量级插件
计算与语言
2025-02-19 v1
摘要
当前基于预训练语言模型的多模态情感分析(MSA)和情感识别(ERC)方法存在两个主要局限性:1)一旦为 MSA 和 ERC 任务训练,这些预训练语言模型就丢失了其原始的通用能力。2)它们需要相当大的计算资源。随着预训练语言模型规模的不断增大,使用现有方法训练更大的多模态情感分析模型可能导致不必要的计算成本。针对这一挑战,我们提出了一种轻量且可适应的插件——多模态情感分析与情感识别适配器(MSE-Adapter)。该插件使大语言模型(LLM)能够以最小的计算开销(仅在 6/7B 模型上引入约 26 万至 28 万可训练参数)完成 MSA 或 ERC 任务,同时保留了 LLM 的内在能力。在 MSE-Adapter 中,引入了 Text-Guide-Mixer(TGM)模块,通过哈达尔积在非文本和文本模态之间建立明确的联系。这允许非文本模态在特征层面更好地与文本模态对齐,从而促进更高质量的伪 token 生成。我们在四个公开的英文和中文数据集上进行了广泛实验,使用消费级 GPU 和开源 LLM(Qwen-1.8B、ChatGLM3-6B-base 和 LLaMA2-7B)作为主干。结果表明,所提出的插件有效且实用。代码将在盲审通过后发布于 GitHub。
引用
@article{arxiv.2502.12478,
title = {MSE-Adapter: A Lightweight Plugin Endowing LLMs with the Capability to Perform Multimodal Sentiment Analysis and Emotion Recognition},
author = {Yang Yang and Xunde Dong and Yupeng Qiang},
journal= {arXiv preprint arXiv:2502.12478},
year = {2025}
}