中文

NLP-CUET@DravidianLangTech-EACL2021:探究视觉与文本特征以从多模态社交媒体表情包识别喷子

计算机视觉与模式识别 2021-03-02 v1 计算与语言

摘要

过去几年中,表情包已成为互联网上一种新的交流方式。由于表情包是嵌有文本的图像,其可快速传播仇恨、冒犯与暴力。由于表情包的多模态特性和地域特定解读,对其分类极具挑战性。一项共享任务旨在开发能从多模态社交媒体表情包中识别喷子的模型。本工作是作为我们参与该任务而开发的计算模型。训练数据有两种形式:嵌有泰米尔语码混合文本的图像,以及给定的英文关联说明文字。我们使用 CNN、VGG16、Inception、Multilingual-BERT、XLM-Roberta、XLNet 模型探究了视觉与文本特征。通过早期融合方法结合图像(CNN、ResNet50、Inception)与文本(长短期记忆网络)特征提取多模态特征。结果表明,采用 XLNet 的文本方法取得了最高的加权 f1f_1-score 0.580.58,使我们的模型在该任务中获得第 33 名。

关键词

引用

@article{arxiv.2103.00466,
  title  = {NLP-CUET@DravidianLangTech-EACL2021: Investigating Visual and Textual Features to Identify Trolls from Multimodal Social Media Memes},
  author = {Eftekhar Hossain and Omar Sharif and Mohammed Moshiul Hoque},
  journal= {arXiv preprint arXiv:2103.00466},
  year   = {2021}
}

备注

3rd rank DravidianLangTech workshop shared task, EACL-2021, 7 pages