中文

MMDT:解码多模态基础模型的可信度与安全性

计算与语言 2025-03-20 v1 人工智能 密码学与安全

摘要

多模态基础模型(MMFMs)在包括自动驾驶、医疗保健和虚拟助手在内的各种应用中发挥着关键作用。然而,已有研究揭示了这些模型存在漏洞,例如文本到图像模型生成不安全内容。现有针对多模态模型的基准测试要么主要评估这些模型的实用性,要么仅关注公平性和隐私等有限视角。本文提出了第一个统一平台 MMDT(Multimodal DecodingTrust),旨在为 MMFMs 提供全面的安全性和可信度评估。我们的平台从多个维度评估模型,包括安全性、幻觉、公平性/偏见、隐私、对抗鲁棒性以及外分布(OOD)泛化。我们为每个维度设计了各种评估情景和红队算法,以生成具有挑战性的数据,形成高质量的基准数据集。我们使用 MMDT 对一系列多模态模型进行评估,发现这些模型在各个维度上存在一系列漏洞和改进空间。这项工作引入了面向 MMFMs 的第一个全面且独特的安全性和可信度评估平台,为开发更安全、更可靠的 MMFMs 和系统铺平了道路。我们的平台和基准数据集可在 https://mmdecodingtrust.github.io/ 上访问。

关键词

引用

@article{arxiv.2503.14827,
  title  = {MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models},
  author = {Chejian Xu and Jiawei Zhang and Zhaorun Chen and Chulin Xie and Mintong Kang and Yujin Potter and Zhun Wang and Zhuowen Yuan and Alexander Xiong and Zidi Xiong and Chenhui Zhang and Lingzhi Yuan and Yi Zeng and Peiyang Xu and Chengquan Guo and Andy Zhou and Jeffrey Ziwei Tan and Xuandong Zhao and Francesco Pinto and Zhen Xiang and Yu Gai and Zinan Lin and Dan Hendrycks and Bo Li and Dawn Song},
  journal= {arXiv preprint arXiv:2503.14827},
  year   = {2025}
}

备注

ICLR 2025