视而不见:针对智能体爬虫的压缩感知内容保护
密码学与安全
2026-07-09 v1 人工智能
摘要
具有推理、摘要和记忆能力的基于LLM的智能体的兴起,为在线内容创造了一个新的威胁面,而传统防御措施无法应对。现有的防御措施(如访问控制)可以被模仿普通浏览器的智能体绕过,而基于注入的防御措施通常会降低人类可读性。在本文中,我们重新审视了智能体流程,并确定了上下文压缩——智能体为适应上下文预算而例行调用的操作——是一个关键但被忽视的防御层。我们提出了CAPE,一个通过注入不可见扰动来保护高价值文本内容的框架,而不改变其人类可见的表面形式,从而在智能体压缩期间诱导严重的信息丢失。CAPE从可访问的替代压缩器中提取破坏性种子扰动,然后通过先验引导的进化和偏好校准的候选优先级排序,使其适应仅查询的目标压缩器,在低查询预算下实现有效保护。在三种内容类型和四种压缩设置上的实验表明,CAPE比最强基线将信息丢失提高了高达75.8%,同时使受保护内容在视觉上与原始内容无法区分。CAPE还可以迁移到现实世界设置,包括LangGraph智能体工作流和GitHub Copilot,突显了其通用性和实用价值。本文旨在揭示上下文压缩作为一个新的防御层,促进智能体时代的内容保护研究。
引用
@article{arxiv.2607.08180,
title = {Out of Sight: Compression-Aware Content Protection against Agentic Crawlers},
author = {Xuefei Wang},
journal= {arXiv preprint arXiv:2607.08180},
year = {2026}
}