中文

QUARC:用于仇恨言论分类的四元数多模态融合架构

机器学习 2020-12-16 v1 计算与语言 声音 音频与语音处理

摘要

仇恨言论在社交媒体时代颇为常见,有时无害,但也可能对某人造成心理创伤甚至引发社区骚乱。带有贬损性评论的宗教符号图像,或辱骂特定群体的男性视频,当其每一种模态(如文本、图像和音频)都对此有所贡献时,便成为仇恨言论。基于社交媒体上某一特定模态仇恨言论的模型并无用处,我们反而需要像多模态融合模型这样在分类仇恨言论时同时考虑图像与文本的模型。文本-图像融合模型参数量巨大,因此我们提出了一种基于四元数神经网络的模型,其为每一对模态设有额外的融合组件。该模型在 MMHS150K 推特数据集上进行了仇恨言论分类测试。与其实数对应模型相比,该模型参数减少近 75%,并在存储空间与训练时间上获益,同时性能相当。

关键词

引用

@article{arxiv.2012.08312,
  title  = {QUARC: Quaternion Multi-Modal Fusion Architecture For Hate Speech Classification},
  author = {Deepak Kumar and Nalin Kumar and Subhankar Mishra},
  journal= {arXiv preprint arXiv:2012.08312},
  year   = {2020}
}

备注

Accepted in Proc. of the 4th International Workshop on Dialog Systems (IWDS2021) in conjunction with the IEEE BigComp2021