多模态 LLM 中的对齐漂移:基于八个模型版本的双相、纵向评估
计算与语言
2026-02-05 v1 人工智能
人机交互
摘要
多模态大型语言模型(MLLMs)正在被部署到实际系统中,但其在对抗性提示下的安全性仍未得到充分探索。我们对 MLLM 的无害性进行了双相评估,使用固定的 726 个对抗性提示,由 26 名专业红队专家编写。阶段 1 评估了 GPT-4o、Claude Sonnet 3.5、Pixtral 12B 和 Qwen VL Plus;阶段 2 评估了它们的后继模型(GPT-5、Claude Sonnet 4.5、Pixtral Large 和 Qwen Omni),得到 82,256 条人类伤害评分。跨模型家族出现大且持续的差异:Pixtral 模型始终最脆弱,而 Claude 模型由于拒绝率高而显得最安全。攻击成功率(ASR)显示出明显的对齐漂移:GPT 和 Claude 模型在各代代际中表现出增加的 ASR,而 Pixtral 和 Qwen 则表现出适度的下降。模态效应也随时间变化:阶段 1 中,文本-only 提示最有效;而阶段 2 产生了模型特定的模式,GPT-5 和 Claude 4.5 在不同模态下的脆弱性几乎相当。这一发现表明,MLLM 的无害性既不统一,也不稳定跨更新,凸显了追踪演变安全行为所需纵向、多模态基准测试。
引用
@article{arxiv.2602.04739,
title = {Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases},
author = {Casey Ford and Madison Van Doren and Emily Dix},
journal= {arXiv preprint arXiv:2602.04739},
year = {2026}
}
备注
under peer-review