模态失语:统一多模态模型能否从记忆中描述图像?
计算机视觉与模式识别
2026-02-17 v2 密码学与安全
摘要
我们提出模态失语(modal aphasia),这是一种系统性解离现象,即当前统一的多模态模型在准确记忆概念图像方面表现出色,但在书面表达时却无法准确阐述,尽管它们在训练时同时使用图像和文本。首先,我们展示了领先的前沿模型能够生成对经典电影艺术品几乎完美的复刻,但在被问及文字描述时会混淆关键细节。我们通过在多个架构上对合成数据集进行受控实验进行了验证。我们的实验确认,模态失语作为当前统一多模态模型的基本属性稳定出现,绝非仅源于训练工艺。实际中,模态失语可能在AI安全框架中引入漏洞,因为应用于一种模态的安全措施可能仍允许另一种模态中访问有害概念。我们通过展示仅基于文本对齐的模型仍能够生成有害图像来说明这一风险。
引用
@article{arxiv.2510.21842,
title = {Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?},
author = {Michael Aerni and Joshua Swanson and Kristina Nikolić and Florian Tramèr},
journal= {arXiv preprint arXiv:2510.21842},
year = {2026}
}
备注
Accepted to ICLR 2026