增强教育数据中个人身份信息的去标识化
计算与语言
2026-01-27 v2 人工智能
摘要
保护个人身份信息(PII)(如姓名)是学习技术中保护学生和教师隐私并维持信任的关键要求。准确的 PII 检测是在匿名化敏感信息的同时保持教育数据可用性的重要步骤。受人工智能最新进展的启发,我们的研究探讨了 GPT-4o-mini 模型作为 PII 检测任务经济高效解决方案的潜力。我们探索了提示和微调两种方法,并将 GPT-4o-mini 的性能与包括 Microsoft Presidio 和 Azure AI Language 在内的成熟框架进行了比较。我们在两个公共数据集 CRAPII 和 TSCC 上的评估表明,微调后的 GPT-4o-mini 模型取得了卓越的性能,在 CRAPII 上的召回率达到 0.9589。此外,微调后的 GPT-4o-mini 显著提高了精确率分数(增加了三倍),同时将计算成本降低至 Azure AI Language 的近十分之一。此外,我们的偏差分析表明,微调后的 GPT-4o-mini 模型在不同文化背景和性别下均能持续提供准确的结果。使用 TSCC 数据集进行的泛化性分析进一步凸显了其鲁棒性,在仅使用 TSCC 的少量额外训练数据时,召回率达到了 0.9895。这些结果强调了微调后的 GPT-4o-mini 作为教育数据 PII 检测准确且经济高效工具的潜力。它在为研究和教学分析保留数据可用性的同时,提供了强大的隐私保护。我们的代码可在 GitHub 上获取:https://github.com/AnonJD/PrivacyAI
关键词
引用
@article{arxiv.2501.09765,
title = {Enhancing the De-identification of Personally Identifiable Information in Educational Data},
author = {Zilyu Ji and Yuntian Shen and Jionghao Lin and Kenneth R. Koedinger},
journal= {arXiv preprint arXiv:2501.09765},
year = {2026}
}