MARMOT:一种用于构建视觉与语言任务多模态表示的深度学习框架
计算机视觉与模式识别
2021-09-24 v1 计算与语言
计算机与社会
机器学习
多媒体
摘要
社交媒体上的政治活动为政治行为提供了数据丰富的窗口,但海量数据意味着几乎所有社交媒体的内容分析都需要数据标注步骤。然而,大多数自动化机器分类方法忽略发布内容的多模态性,仅关注文本或图像。最先进的视觉与语言模型对大多数政治科学研究不可用:它们要求所有观测同时具有图像和文本,且需要计算代价高昂的预训练。本文提出一种称为基于模态翻译的多模态表示(MARMOT)的新型视觉与语言框架。MARMOT 提出两项方法学贡献:它可为缺失图像或文本的观测构建表示,并用模态翻译替代计算昂贵的预训练。在 2016 年美国大选期间报告选举事件的推文多标签分类中,MARMOT 在 20 个类别中的 19 个上优于集成纯文本分类器。此外,MARMOT 在 Hateful Memes 数据集上相较基准多模态模型结果有显著提升,将 VisualBERT 所设最佳结果在准确率上从 0.6473 提升至 0.6760,在受试者工作特征曲线下面积(AUC)上从 0.7141 提升至 0.7530。
引用
@article{arxiv.2109.11526,
title = {MARMOT: A Deep Learning Framework for Constructing Multimodal Representations for Vision-and-Language Tasks},
author = {Patrick Y. Wu and Walter R. Mebane},
journal= {arXiv preprint arXiv:2109.11526},
year = {2021}
}
备注
57 pages, 16 figures. Forthcoming in Computational Communication Research