中文

通过输入空间转换利用BERT进行多模态目标情感分类

计算与语言 2021-08-09 v2 计算机视觉与模式识别

摘要

多模态目标/方面情感分类结合了多模态情感分析与方面/目标情感分类。该任务的目标是结合视觉与语言来理解句子中对某一目标实体的情感。Twitter是该任务的理想场景,因为它本质上是多模态的、高度情绪化的,并影响着现实世界的事件。然而,多模态推文篇幅短小,且伴有复杂且可能无关的图像。我们引入了一个双流模型,该模型使用物体感知的Transformer在输入空间中对图像进行转换,随后采用单次非自回归文本生成方法。然后,我们利用转换结果构建一个辅助句子,为语言模型提供多模态信息。我们的方法增加了语言模型可用的文本量,并提炼了复杂图像中的物体级信息。我们在两个多模态Twitter数据集上取得了最先进的性能,而无需修改语言模型的内部结构以接受多模态数据,这证明了我们转换方法的有效性。此外,我们还解释了当应用于推文时,一种流行的方面情感分析方法的失效模式。我们的代码可在\textcolor{blue}{\url{https://github.com/codezakh/exploiting-BERT-thru-translation}}获取。

关键词

引用

@article{arxiv.2108.01682,
  title  = {Exploiting BERT For Multimodal Target Sentiment Classification Through Input Space Translation},
  author = {Zaid Khan and Yun Fu},
  journal= {arXiv preprint arXiv:2108.01682},
  year   = {2021}
}

备注

ACM Multimedia 2021 Oral