视觉-语言模型综述及其在 Hateful Memes Challenge 上的表现
计算与语言
2023-05-11 v1 人工智能
摘要
社交媒体内容审核目前是一项高度人工的任务,然而每天发布的内容过多,难以有效完成。随着若干多模态模型的出现,有望减少该任务的人工工作量。在这项工作中,我们旨在探索不同模型,并确定哪种对 Hateful Memes Challenge 最有效——该挑战由 Meta 提出,旨在推动内容审核方面的机器学习研究。具体而言,我们探索早期融合与晚期融合模型在分类含文本和图像的多模态表情包上的差异。我们首先分别使用 BERT 和 ResNet-152 以单模态模型对文本和图像实现基线。随后将这些单模态模型的输出拼接在一起,创建晚期融合模型。在早期融合模型方面,我们实现了 ConcatBERT、VisualBERT、ViLT、CLIP 和 BridgeTower。结果发现晚期融合表现明显劣于早期融合模型,表现最好的模型是 CLIP,其 AUROC 达到 70.06。本工作的代码发布于 https://github.com/bzhao18/CS-7643-Project。
引用
@article{arxiv.2305.06159,
title = {A Review of Vision-Language Models and their Performance on the Hateful Memes Challenge},
author = {Bryan Zhao and Andrew Zhang and Blake Watson and Gillian Kearney and Isaac Dale},
journal= {arXiv preprint arXiv:2305.06159},
year = {2023}
}