中文

利用图文辅助任务改进社交媒体帖子的多模态分类

计算与语言 2024-02-06 v2 机器学习 社会与信息网络

摘要

有效利用社交媒体帖子中的多模态信息对于情感分析、讽刺检测或仇恨言论分类等多种下游任务至关重要。联合建模文本与图像具有挑战性,因为跨模态语义可能隐藏,或图像与文本之间的关系较弱。然而,先前关于社交媒体帖子多模态分类的研究尚未解决这些挑战。在本工作中,我们针对在多模态模型微调期间将两种辅助损失与主任务联合使用的有效性进行了广泛研究。首先,图文对比(ITC)旨在缩小帖子内图像-文本表示之间的距离,从而有效弥合图像在传达帖子含义中起重要作用的帖子之间的差距。其次,图文匹配(ITM)增强了模型理解图像与文本之间语义关系的能力,从而提升其处理模糊或松散相关模态的能力。我们将这些目标与五种多模态模型在五个不同的社交媒体数据集上结合,展示了高达 2.6 个 F1 点的稳定提升。我们的综合分析展示了每种辅助任务最有效的具体场景。

关键词

引用

@article{arxiv.2309.07794,
  title  = {Improving Multimodal Classification of Social Media Posts by Leveraging Image-Text Auxiliary Tasks},
  author = {Danae Sánchez Villegas and Daniel Preoţiuc-Pietro and Nikolaos Aletras},
  journal= {arXiv preprint arXiv:2309.07794},
  year   = {2024}
}

备注

Accepted at EACL 2024 Findings