面向目标增强的多模态讽刺解释生成
计算与语言
2025-02-12 v1
摘要
讽刺是一种旨在讽刺特定目标(如实体、事件或人物)的语言现象。多模态讽刺解释(MuSE)旨在使用自然语言解释揭示讽刺帖子中意图的讽刺。尽管重要,但现有系统忽视了讽刺目标在生成解释中的重要性。本文提出一种目标增强共享融合基于讽刺解释的模型,称为 TURBO。我们设计了一种新颖的共享融合机制,利用图像及其标题之间的跨模态关系。TURBO 假设讽刺的目标,并引导多模态共享融合机制学习解释中意图讽刺的细节。我们在 MORE+ 数据集上评估了所提出的 TURBO 模型。与多个基线和最新模型进行比较表明,TURBO 平均提升了 +3.3%。此外,我们探索了在本任务中使用大语言模型(LLM)进行零-shot 和 one-shot 设置,发现尽管 LLM 生成的解释相当突出,但常常未能捕捉讽刺的关键细微差别。进一步,我们对 TURBO 生成的解释进行了大量人类评估,发现其在其他系统之上。
引用
@article{arxiv.2502.07391,
title = {Target-Augmented Shared Fusion-based Multimodal Sarcasm Explanation Generation},
author = {Palaash Goel and Dushyant Singh Chauhan and Md Shad Akhtar},
journal= {arXiv preprint arXiv:2502.07391},
year = {2025}
}