中文

面向后量子安全通信的混合混沌密码框架

计算机视觉与模式识别 2025-10-16 v2

摘要

手写文字识别(HTR)是文档数字化的关键任务,但手写数据可能包含用户可识别特征(如独特的书写风格),存在隐私风险。《忘却权》等法规要求在不进行完整重新训练的前提下删除这些敏感痕迹。我们引入一种实用的仅编码器的Transformer基线,作为未来HTR研究的稳健参考。基于此,我们提出了一种针对多头Transformer HTR模型的两阶段遗忘框架。该方法结合神经网络修剪与应用于作家分类头的机器遗忘技术,确保移除敏感信息同时保留识别头性能。我们还提出了作家ID混淆(WIC)方法,使遗忘集合遵循作家身份的均匀分布,在遗忘用户特定线索的同时保持文本识别性能。我们将WIC与随机标记、Fisher遗忘、Amnesiac遗忘和DELETE进行比较,并在修剪-遗忘管道中始终实现更好的隐私与准确率权衡。这项工作是HTM的机器遗忘系统性研究。使用准确率、字符错误率(CER)、词错误率(WER)和成员推断攻击(MIA)等指标评估,我们在IAM和CVL数据集上表明该方法实现了最先进或优异的遗忘效果。这些实验表明,我们的方法在不损害准确率的前提下有效保护了隐私,为文档分析研究开辟了新的方向。我们的代码已公开于https://github.com/leitro/WIC-WriterIDConfusion-MachineUnlearning。

关键词

引用

@article{arxiv.2504.08616,
  title  = {Preserving Privacy Without Compromising Accuracy: Machine Unlearning for Handwritten Text Recognition},
  author = {Lei Kang and Xuanshuo Fu and Lluis Gomez and Alicia Fornés and Ernest Valveny and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2504.08616},
  year   = {2025}
}

备注

Accepted for publication in Pattern Recognition, DOI: https://doi.org/10.1016/j.patcog.2025.112411