增强现实中矛盾虚拟内容攻击下视觉语言模型的基准测试
计算机视觉与模式识别
2026-04-14 v2
摘要
增强现实(AR)在过去十年中迅速扩展。随着AR日益融入日常生活,其安全性与可靠性成为关键挑战。在各种威胁中,矛盾虚拟内容攻击——即将恶意或不一致的虚拟元素引入用户视图——通过误导用户、造成语义混淆或传递有害信息构成独特风险。在本工作中,我们系统地建模此类攻击,并提出了ContrAR,一个用于评估视觉语言模型(VLM)在AR环境中面对虚拟内容操控与矛盾时的鲁棒性的新型基准。ContrAR包含312个经10名人工参与者验证的真实AR视频。我们进一步对11种VLM进行了基准测试,包括商业和开源模型。实验结果表明,虽然当前VLM对矛盾虚拟内容展现出合理的理解能力,但在检测和推理AR环境中的对抗性内容操控方面仍有改进空间。此外,在检测准确率与延迟之间取得平衡仍然具有挑战性。
引用
@article{arxiv.2604.05510,
title = {Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality},
author = {Yanming Xiu and Zhengyuan Jiang and Neil Zhenqiang Gong and Maria Gorlatova},
journal= {arXiv preprint arXiv:2604.05510},
year = {2026}
}
备注
CVPR 2026 Findings