中文

SemEval-2025任务4:从大型语言模型中忘却敏感内容

计算与语言 2025-04-07 v1 机器学习

摘要

我们介绍SemEval-2025任务4:从大型语言模型(LLM)中忘却敏感内容。该任务涵盖三个子任务,涉及LLM的忘却技术,分别针对不同应用场景:(1)忘却跨越不同体裁的长篇合成创意文档;(2)忘却包含可识别个人信息(PII)的短篇合成传记,包括虚构姓名、电话号码、社会安全号码、电子邮件地址和住址;(3)忘却从目标模型训练数据集中抽取的真实文档。我们收到了来自30多所机构的100多份提交成果,本文总结了关键技术与经验教训。

关键词

引用

@article{arxiv.2504.02883,
  title  = {SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models},
  author = {Anil Ramakrishna and Yixin Wan and Xiaomeng Jin and Kai-Wei Chang and Zhiqi Bu and Bhanukiran Vinzamuri and Volkan Cevher and Mingyi Hong and Rahul Gupta},
  journal= {arXiv preprint arXiv:2504.02883},
  year   = {2025}
}