面向引导网页智能体偏好的跨模态内容优化
人工智能
2025-10-07 v1 密码学与安全
摘要
基于视觉语言模型(VLM)的网页智能体日益用于高风险选择任务(如内容推荐或产品排序),通过融合多模态感知与偏好推理。近期研究表明,这些智能体易受攻击者通过对抗性弹出窗口、图像扰动或内容微调来偏置选择结果的攻击。现有工作要么假设强白盒访问且仅限单模态扰动,要么采用不切实际的设置。本文首次展示,同时利用视觉与文本通道可在真实攻击者能力下实现更强大的偏好操控。我们引入跨模态偏好引导(Cross-Modal Preference Steering, CPS),联合优化项目视觉与自然语言描述的难以察觉修改,利用CLIP可迁移的图像扰动和RLHF诱导的语言偏差来引导智能体决策。与假设梯度访问、网页控制或智能体记忆的先前研究不同,我们采用真实的黑盒威胁模型:非特权攻击者仅可编辑自身 listing 的图像和文本元数据,无需洞察智能体模型内部。我们在由最先进专有及开源VLMs(包括GPT-4.1、Qwen-2.5VL和Pixtral-Large)驱动的智能体上评估了CPS,涵盖电影选择与电商任务。结果表明,CPS显著优于领先基线方法。例如,我们的结果显示,CPS在所有模型上均实现一致优势,同时保持约70%更低的检测率,凸显其有效性与隐蔽性。这些发现凸显了随着智能体系统在社会中发挥越来越重要的作用,对健壮防御的紧迫需求。
引用
@article{arxiv.2510.03612,
title = {Cross-Modal Content Optimization for Steering Web Agent Preferences},
author = {Tanqiu Jiang and Min Bai and Nikolaos Pappas and Yanjun Qi and Sandesh Swamy},
journal= {arXiv preprint arXiv:2510.03612},
year = {2025}
}