基于对比学习的多模态架构用于表情符号预测——结合图像-文本配对
计算机视觉与模式识别
2024-08-06 v1 人工智能
摘要
表情符号是通常伴随文本内容的符号性表示,用于视觉上增强或概括书面消息的真实意图。尽管在社交媒体领域被广泛使用,但这些表情符号的核心语义尚未在多模态基础上得到广泛探讨。将文本与视觉信息融合于单一消息中,发展了一种更为先进的信息传递方式。因此,本研究旨在分析句子、视觉元素与表情符号之间的关系。为了便于阐述,本文首先详细检视了各种用于提取多模态特征的技术,强调每种方法的优势与不足。通过对多种多模态算法进行全面检视,特别强调融合方法,我们提出了一种 novel 对比学习基于多模态架构。该 proposed 模型采用双分支编码器联合训练,同时引入对比学习,以准确地将文本和图像映射到共用的潜在空间。我们的关键发现在于,通过将对比学习原理与另外两个分支的原理相结合,可获得更佳的效果。实验结果表明,我们的 suggested 方法在准确率和鲁棒性方面均优于现有的多模态方法。该 model 在使用来自 Twitter 的 Multimodal-Twitter Emoticon 数据集评估表情符号时,达到了91%的准确率和90%的 MCC 分数。我们提供了依据,表明对比学习获取的深度特征更为高效,表明该 fusion 技术也具备强大的泛化能力,能够在多种模式下识别表情符号。
引用
@article{arxiv.2408.02571,
title = {Contrastive Learning-based Multi Modal Architecture for Emoticon Prediction by Employing Image-Text Pairs},
author = {Ananya Pandey and Dinesh Kumar Vishwakarma},
journal= {arXiv preprint arXiv:2408.02571},
year = {2024}
}