中文

面向多模态方面级情感分析的视觉-语言预训练

计算机视觉与模式识别 2022-04-22 v2 计算与语言 多媒体

摘要

作为情感分析中的一项重要任务,多模态方面级情感分析(MABSA)近年来受到越来越多的关注。然而,以往的方法要么(i)使用分别预训练的视觉和文本模型,忽略了跨模态对齐;要么(ii)使用通过通用预训练任务预训练的视觉-语言模型,不足以识别细粒度的方面、观点及其跨模态对齐。为应对这些局限,我们提出了一种面向 MABSA 的任务特定视觉-语言预训练框架(VLPMABSA),其为所有预训练与下游任务设计的统一多模态编码器-解码器架构。我们进一步分别从语言、视觉和多模态三种模态设计了三类任务特定的预训练任务。实验结果表明,我们的方法在三个 MABSA 子任务上总体优于当前最优(SOTA)方法。进一步分析证明了各预训练任务的有效性。源代码已公开发布于 https://github.com/NUSTM/VLP-MABSA。

关键词

引用

@article{arxiv.2204.07955,
  title  = {Vision-Language Pre-Training for Multimodal Aspect-Based Sentiment Analysis},
  author = {Yan Ling and Jianfei Yu and Rui Xia},
  journal= {arXiv preprint arXiv:2204.07955},
  year   = {2022}
}

备注

Accepted by ACL 2022 (long paper)