利用大型视觉语言模型检测与纠正多模态表情包中的仇恨言论
计算与语言
2023-11-14 v1 人工智能
摘要
近来,大语言模型(LLMs)成为自然语言处理领域的焦点。进一步,将 LLM 与视觉集成使用户能够探索多模态中更多涌现能力。视觉语言模型(VLMs),如 LLaVA、Flamingo 或 GPT-4,已在多种视觉-语言任务上展现出令人印象深刻的性能。因此,大型模型在社交媒体平台上有大量潜在应用。尽管如此,利用 VLM 检测或纠正仇恨表情包的相关工作仍属空白。本工作中,我们研究了 VLM 在零样本提示下完成仇恨表情包检测与仇恨表情包纠正任务的能力。通过实证实验,我们展示了预训练 LLaVA 模型的有效性,并讨论了其在这些任务中的优势与不足。
引用
@article{arxiv.2311.06737,
title = {Detecting and Correcting Hate Speech in Multimodal Memes with Large Visual Language Model},
author = {Minh-Hao Van and Xintao Wu},
journal= {arXiv preprint arXiv:2311.06737},
year = {2023}
}