中文

行动前的时空解耦:面向多模态情感分析的解耦表示学习

计算与语言 2026-01-21 v1 人工智能 多媒体

摘要

多模态情感分析融合了语言、视觉和声学模态。基于模态不变与模态特定因子分解或复杂融合的主流方法仍依赖于时空混合建模。这忽略了时空异构性,导致时空信息不对称,从而限制了性能。因此,我们提出 TSDA(行动前的时空解耦),在任何交互之前将每个模态显式解耦为时间动态和空间结构上下文。对于每个模态,时间编码器和空间编码器将信号投影到独立的时间和空间体中。随后,因子一致性跨模态对齐仅将时间特征与跨模态的时间对应特征对齐,仅将空间特征与跨模态的空间对应特征对齐。因子特定监督与去相关正则化在保持互补性的同时减少了跨因子泄漏。门控重耦合模块随后将已对齐的流重新耦合以用于任务。大量实验表明 TSDA 优于基线方法。消融分析研究证实了该设计的必要性与可解释性。

关键词

引用

@article{arxiv.2601.13659,
  title  = {Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment Analysis},
  author = {Chunlei Meng and Ziyang Zhou and Lucas He and Xiaojing Du and Chun Ouyang and Zhongxue Gan},
  journal= {arXiv preprint arXiv:2601.13659},
  year   = {2026}
}

备注

This study has been accepted by IEEE ICASSP2026