基于多源语义图的多模态讽刺解释生成
计算与语言
2023-06-30 v1 人工智能
摘要
多模态讽刺解释(MuSE)是一项新颖且具有挑战性的任务,旨在为一条多模态社交帖子(一张图像及其标题)生成自然语言句子以解释其为何包含讽刺。尽管现有的开创性研究借助BART骨干取得了很大成功,但它忽视了视觉特征空间与解码器语义空间之间的鸿沟、图像的对象级元数据,以及潜在的外部知识。为解决这些局限,本文提出一种新颖的基于多源语义图的多模态讽刺解释方案,命名为TEAM。具体而言,TEAM从输入图像中提取对象级语义元数据,而非传统的全局视觉特征。同时,TEAM借助ConceptNet为输入文本及提取的对象元数据获取外部相关知识概念。此后,TEAM引入一个多源语义图,全面刻画多源(即标题、对象元数据、外部知识)语义关系以促进讽刺推理。在公开数据集MORE上的大量实验验证了我们的模型相对于前沿方法的优越性。
引用
@article{arxiv.2306.16650,
title = {Multi-source Semantic Graph-based Multimodal Sarcasm Explanation Generation},
author = {Liqiang Jing and Xuemeng Song and Kun Ouyang and Mengzhao Jia and Liqiang Nie},
journal= {arXiv preprint arXiv:2306.16650},
year = {2023}
}
备注
Accepted by ACL 2023 main conference