在互联网上,没人知道你是一个LLM机器人:用多层指纹识别揭开网络智能体的面纱
密码学与安全
2026-06-29 v1
摘要
自2023年以来,一类新的机器人出现了:网络智能体。它们可以自动化Web上的复杂任务,超越了Selenium、Puppeteer或Playwright等传统浏览器自动化工具。利用大语言模型(LLM),这些智能体能够解决反机器人机制,模仿人类行为,在某些情况下,甚至可以直接从配置它们的用户的本地机器上操作。因此,网站管理员越来越难以检测和阻止这些基于LLM的机器人。现代网络智能体通常集成了隐身和反检测技术,而最近也出现了许多专门用于阻止它们的专有和开源反机器人机制。然而,尽管它们日益普遍,但针对这些基于LLM的机器人及其隐身能力,最先进的反机器人机制的有效性评估却很少。同样,也没有先前的工作全面研究如何表征和区分部署在云端或本地的网络智能体。本文通过在多个蜜罐网站上部署一种或多种反机器人机制(例如robots.txt、CAPTCHA、工作量证明和Cloudflare的免费专有解决方案)来解决这些开放问题。我们集成了网络层、HTTP层和浏览器层的指纹识别技术,并提示六个基于LLM的网络智能体访问部署的蜜罐网站。我们的分析揭示了三个主要发现:(i)一些网络智能体能够绕过所有评估的反机器人机制;(ii)所有评估的网络智能体都可以通过跨网络、HTTP和浏览器层的多层指纹识别技术与人类以及彼此区分开来;(iii)隐身和反检测机制通常会增加可检测性,而不是降低它。
引用
@article{arxiv.2606.30119,
title = {On the Internet, Nobody Knows You're an LLM Bot: Unmasking Web Agents with Multi-Layer Fingerprinting},
author = {Iliana Fayolle and Sihem Bouhenniche and Samuel Pélissier and Pierre Laperdrix and Clémentine Maurice and Walter Rudametkin},
journal= {arXiv preprint arXiv:2606.30119},
year = {2026}
}