前沿大语言模型中隐写术能力的早期迹象
密码学与安全
2025-10-16 v2 人工智能
计算与语言
机器学习
摘要
监控大语言模型(LLM)的输出对于减轻滥用和误对齐风险至关重要。然而,LLM可能通过隐写术来规避监控:在看似无害的生成内容中编码隐藏信息。本文评估了前沿LLM中隐写术能力,以更好地理解其所构成的风险。我们关注两种类型的隐写术:传递编码消息和执行编码推理。我们发现,在标准做法下,当前模型无法在不被监控器察觉的情况下编码短消息。但如果获得额外的做法,例如使用未被监控的草稿纸并协商编码方案,将会成功。我们 additionally 发现,模型展现出在简单状态跟踪问题中执行基本编码推理的早期迹象。这包括一些能够使用自身和预定义方案的推理能力,包括十六进制等编码方案。尽管如此,它们很少能在隐蔽任务中隐藏推理以欺骗监控器。总体而言,本文的结果表明当前的LLM exhibits 潜在的隐写术能力。虽然这些能力目前可能不足以规避设计良好的监控器,但未来可能会发生变化。
引用
@article{arxiv.2507.02737,
title = {Early Signs of Steganographic Capabilities in Frontier LLMs},
author = {Artur Zolkowski and Kei Nishimura-Gasparian and Robert McCarthy and Roland S. Zimmermann and David Lindner},
journal= {arXiv preprint arXiv:2507.02737},
year = {2025}
}