中文

NLP 模型隐私评估基准

人工智能 2024-10-22 v5

摘要

通过诱导隐私攻击,攻击者可获取训练数据和模型参数等敏感信息。尽管研究者已深入探讨了 NLP 模型中的多种攻击类型,但这些攻击缺乏系统性分析,导致对其影响缺乏全面理解。例如,必须考虑哪些场景适用于哪些攻击、不同攻击的共同影响因素、攻击之间关系的本质,以及不同数据集和模型对攻击效果的影响等问题。因此,亟需一个基准来全面评估 NLP 模型所面临的隐私风险。本文提出了面向 NLP 领域的隐私攻击与防御评估基准,涵盖常规/小模型和大型语言模型(LLM)。该基准支持多种模型、数据集和协议,配备标准化模块进行攻击和防御策略的综合评估。基于上述框架,我们研究了不同域的辅助数据与隐私攻击强度之间的关联性。并通过知识蒸馏(KD)帮助提升了该情景下的攻击方法。此外,我们提出了一套链式隐私攻击框架,允许实践者串联多次攻击以实现更高层次的攻击目标。基于此,我们提供了一些防御和增强攻击策略。复现实验结果的代码已公开:https://github.com/user2311717757/nlp_doctor。

关键词

引用

@article{arxiv.2409.15867,
  title  = {In-Context Ensemble Learning from Pseudo Labels Improves Video-Language Models for Low-Level Workflow Understanding},
  author = {Moucheng Xu and Evangelos Chatzaroulas and Luc McCutcheon and Abdul Ahad and Hamzah Azeem and Janusz Marecki and Ammar Anwar},
  journal= {arXiv preprint arXiv:2409.15867},
  year   = {2024}
}

备注

To appear in NeurIPS Workshop on Video-Language Models 2024