面向临床类级忘却的参数高效 Token 嵌入编辑
机器学习
2026-03-23 v1 人工智能
摘要
机器忘却在临床语言模型中日益重要,因为隐私法规和机构政策可能要求在不从头重新训练的情况下从已部署系统中删除敏感信息。在实践中,删除请求必须在有效忘却目标信息与保持模型实用性以及最小化参数修改之间进行平衡。我们引入稀疏 Token 嵌入忘却 (Sparse Token Embedding Unlearning, STEU),一种用于行为类级忘却的参数高效方法,仅更新与 PMI 选取的 token 嵌入以及小型分类器头,同时保持所有编码器层冻结。在基于 MIMIC-IV、MIMIC-III 和 eICU 上的实验中,使用 BioClinicalBERT、BERT-base 和 DistilBERT,STEU 一致抑制目标类,同时基本保持保留的任务性能。在主要的 MIMIC-IV 设置下,STEU 实现近乎完全的忘却 (forget F1 = 0.0004),同时保持竞争性的保留实用性 (retain avg F1 = 0.4766),仅修改了 0.19% 的模型参数。这些结果表明,针对性的行为忘却可以通过稀疏嵌入编辑实现,而无需修改更深层的编码器表示。
引用
@article{arxiv.2603.19302,
title = {Parameter-Efficient Token Embedding Editing for Clinical Class-Level Unlearning},
author = {Iyad Ait Hou and Shrenik Borad and Harsh Sharma and Pooja Srinivasan and Rebecca Hwa and Aya Zirikly},
journal= {arXiv preprint arXiv:2603.19302},
year = {2026}
}
备注
10 pages