¡Qué maravilla! 西班牙语多模态讽刺检测:一个数据集与基线
计算与语言
2021-05-13 v1
摘要
我们构建了首个西班牙语多模态讽刺数据集。该视听数据集由与视频和音频对齐的讽刺标注文本组成。该数据集代表了西班牙语的两种变体,一种拉丁美洲变体和一种伊比利亚西班牙语变体,从而确保了这一全球语言的更广泛方言覆盖。我们提出了几种用于讽刺检测的模型,作为未来研究的基线。我们的结果表明,仅使用文本的结果(89%)劣于文本与音频结合的结果(91.9%)。最后,当结合所有模态——文本、音频和视频时,获得了最佳结果(93.1%)。
引用
@article{arxiv.2105.05542,
title = {!Qu\'e maravilla! Multimodal Sarcasm Detection in Spanish: a Dataset and a Baseline},
author = {Khalid Alnajjar and Mika Hämäläinen},
journal= {arXiv preprint arXiv:2105.05542},
year = {2021}
}
备注
Accepted to The Third Workshop on Multimodal Artificial Intelligence (MAI-Workshop)