GOAT-Bench:通过基于模因的社会虐待洞察大型多模态模型的安全性
计算与语言
2025-03-03 v4 人工智能
摘要
社交媒体的指数级增长深刻改变了信息创建、传播和吸收的方式,超越了数字时代的任何先例。遗憾的是,这种爆炸式增长也导致了在线模因虐待的显著增加。评估模因的负面影响尤为困难,因为它们通常具有微妙和隐含的含义,并非通过显式的文本和图像直接传达。鉴于此,大型多模态模型(LMMs)因其在处理多样化多模态任务方面的卓越能力而成为关注的焦点。针对这一发展,本文旨在深入考察各种LMMs(例如GPT-4o)识别和回应模因中表现出的社会虐待细微方面的能力。我们引入了全面的模因基准GOAT-Bench,包含超过6000个多样化模因,涵盖了隐含仇恨言论、性别歧视和网络欺凌等主题。利用GOAT-Bench,我们探究了LMMs准确评估仇恨性、厌女、冒犯性、讽刺和有害内容的能力。我们在多种LMMs上进行的广泛实验表明,当前模型在安全意识方面仍存在不足,对各种形式的隐含虐待表现出不敏感性。我们认为这一缺陷是实现安全人工智能的关键障碍。GOAT-Bench及配套资源可在https://goatlmm.github.io/公开获取,为这一重要领域的持续研究做出贡献。
引用
@article{arxiv.2401.01523,
title = {GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse},
author = {Hongzhan Lin and Ziyang Luo and Bo Wang and Ruichao Yang and Jing Ma},
journal= {arXiv preprint arXiv:2401.01523},
year = {2025}
}
备注
The first work to benchmark Large Multimodal Models in safety insight on social media