中文

将数据追踪式机器遗忘提升至基座模型的数据-知识遗忘

计算机视觉与模式识别 2026-05-27 v2 机器学习

摘要

机器遗忘从AI模型中移除特定训练数据点及其影响(例如,当数据所有者撤回其数据允许模型从中学习的同意时)。在本位置论文中,我们提出将数据追踪式机器遗忘提升至基座模型的数据-知识遗忘。我们基于实际需求和认知研究的见解支持这一立场。实际上,数据追踪无法满足基座模型(FMs)的多样化遗忘请求,这些请求可能来自监管机构、企业用户、产品团队等,且无需访问FMs的大规模训练数据。相反,这些当事方更方便地发出关于FMs应(不)具备的知识或能力的遗忘请求。认知上,数据-知识遗忘更贴近人类大脑的遗忘方式,而非追踪单个训练数据点。我们进一步讨论数据-知识遗忘范式中的非平凡挑战。最后,我们提供一个关于视觉-语言基座模型的具体案例研究,以说明遗忘者如何实现数据-知识遗忘范式。代码地址:https://1yuwen.github.io/Knowledge-Tracing-MU-Page

关键词

引用

@article{arxiv.2506.11253,
  title  = {Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models},
  author = {Yuwen Tan and Boqing Gong},
  journal= {arXiv preprint arXiv:2506.11253},
  year   = {2026}
}

备注

Accepted to TMLR