C-CLIP:用于弥合描述性-评论性鸿沟的对比图像-文本编码器
计算机视觉与模式识别
2023-09-11 v1
摘要
社交媒体帖子中图像与评论之间的相互作用对于理解其整体信息至关重要。多模态嵌入模型(即 CLIP)近期的进展为关联图像与文本提供了前进道路。然而,当前的 CLIP 模型训练机制不足以匹配社交媒体上的内容,无论站点或语言。当前 CLIP 训练数据基于我们所称的“描述性”文本:仅对图像进行描述的文本。这在社交媒体上很少见,其中绝大多数文本内容本质上是“评论性”的。这些文字说明提供与图像相关的评论与更宽泛的语境,而非描述图像中的内容。当前 CLIP 模型在图像-文字说明对呈现评论性关系的检索任务上表现不佳。弥合这一鸿沟将有益于若干与社交媒体相关的重要应用领域。例如,它将使专注于开源情报行动(OSINT)的团体能够在灾难事件(如正在进行的俄罗斯入侵乌克兰)中进一步辅助工作,通过轻松将数据暴露给非技术用户以进行发现与分析。为弥合这一鸿沟,我们证明在显式评论性对上训练对比图像-文本编码器可带来检索结果的巨大提升,且结果延伸至多种非英语语言。
引用
@article{arxiv.2309.03921,
title = {C-CLIP: Contrastive Image-Text Encoders to Close the Descriptive-Commentative Gap},
author = {William Theisen and Walter Scheirer},
journal= {arXiv preprint arXiv:2309.03921},
year = {2023}
}
备注
11 Pages, 5 Figures