硬 Token 透露什么:基于低置信度 Token 的大语言模型成员推断攻击
密码学与安全
2026-01-30 v1
摘要
随着大语言模型(LLM)的广泛采用和日益严格的隐私法规,保护LLM中的数据隐私尤其在隐私敏感应用中至关重要。成员推断攻击(Membership Inference Attack, MIA)旨在判断特定数据样本是否包含在模型训练/微调数据集中,构成严重的隐私风险。然而,现有大多数MIA技术依赖序列级聚合预测统计,无法区分由泛化引起的预测改进与由记忆效应引起的改进,导致攻击效果不佳。为此,本文提出一种新颖的成员推断方法,捕获低置信度(硬)Token的token级概率,其中成员信号更为显著。通过比较微调目标模型与预训练参考模型在硬Token处的token级概率提升,HT-MIA能够隔离由前述方法遮蔽的强大且稳健的成员信号。在医学领域特定数据集和通用基准上进行的广泛实验表明,HT-MIA持续优于七种SOTA MIA基线方法。我们进一步探讨了差分隐私训练作为对LLM成员推断攻击的有效防御机制。总体而言,本文的HT-MIA框架确立了基于硬Token分析的大语言模型成员推断攻击与防御的SOTA基础。
引用
@article{arxiv.2601.20885,
title = {What Hard Tokens Reveal: Exploiting Low-confidence Tokens for Membership Inference Attacks against Large Language Models},
author = {Md Tasnim Jawad and Mingyan Xiao and Yanzhao Wu},
journal= {arXiv preprint arXiv:2601.20885},
year = {2026}
}