漏洞思考:大规模推理模型并非私密思考者
计算与语言
2025-10-02 v2 人工智能
密码学与安全
摘要
我们研究大规模推理模型用作个人智能体时推理痕迹中的隐私泄露问题。与最终输出不同,推理痕迹常被假设为内部且安全。我们通过实证揭示,推理痕迹经常包含敏感用户数据,可通过 prompt 注入被提取或意外泄露至输出。通过探测性实验和智能体评估,我们表明,尤其是增加推理步骤的 test-time compute 方法会放大此类泄露。虽然增加这些 test-time compute 方法的预算会使模型在最终答案中更谨慎,但也导致其在自身思考中更冗长地推理,从而增加泄露。这揭示了核心矛盾:推理提升了实用性,但扩大了隐私攻击面。我们认为,安全措施必须扩展到模型的内部思考,而不仅限于其输出。
引用
@article{arxiv.2506.15674,
title = {Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers},
author = {Tommaso Green and Martin Gubri and Haritz Puerto and Sangdoo Yun and Seong Joon Oh},
journal= {arXiv preprint arXiv:2506.15674},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Main)