重新思考融合:面向立场检测的解耦学习的共享与模态特定信息
多媒体
2026-01-30 v1
摘要
多模态立场检测(MSD)旨在使用文本和视觉内容确定作者对给定目标的立场。虽然最近的方法利用多模态融合和基于提示的学习,但大多数方法无法区分模态特定信号与跨模态证据,导致性能 suboptimal。我们提出 DiME(解耦多模态专家),一种新型架构,显式地将立场信息分离为文本主导、视觉主导和跨模态共享三个组成部分。DiME 首先使用面向目标的链式思维提示生成推理引导的文本输入。随后,双编码器提取模态特征,这些特征被处理为三个具有专门损失函数的专家模块:对模态特定专家进行对比学习,对共享表示学习进行余弦对齐。一个门控网络自适应地融合专家输出用于最终预测。在四个基准数据集上的实验表明,DiME 在面向目标和零样本设置下均一致优于强大的单模态和多模态基线。
引用
@article{arxiv.2601.21675,
title = {Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection},
author = {Zhiyu Xie and Fuqiang Niu and Genan Dai and Qianlong Wang and Li Dong and Bowen Zhang and Hu Huang},
journal= {arXiv preprint arXiv:2601.21675},
year = {2026}
}
备注
ICASSP 2026