数学教学中的效用保留去识别:调查 MathEd-PII 数据集中的数值歧义
计算与语言
2026-05-11 v2
摘要
大规模共享对话数据是推动教育科学发展的关键,但严格的去识别仍是一个主要障碍。在数学教学录音中,数值表达式常常类似于结构化标识符(例如日期或 ID),导致通用的个人可识别信息(PII)检测系统对核心教学内容进行过度屏蔽,从而降低数据效用。本工作询问如何在保持教育效用的前提下检测 PII,聚焦于此“数值歧义”问题。我们引入 MathEd-PII,这是首个针对数学教学对话中 PII 检测的基准数据集,由人类在回路中的 LLM 注释构建。使用基于密度的分段,我们显示,错误的 PII 重映射在数学密集区域聚集,确认数值歧义是关键的失效模式。我们随后比较四种检测策略:Presidio 基线和三个基于 LLM 的方法,分别采用基本、数学感知和分段感知的提示。领域感知的提示,包括两种数学感知(F1:0.802)和分段感知版本(F1:0.821),均显著优于基线(F1:0.379),同时减少了数值错误的误报,表明去识别必须包含领域上下文才能保留分析效用。本工作提供了一个新的基准,并提供了证据,表明为教育数据进行效用保留的去识别需要包含领域建模。
引用
@article{arxiv.2602.16571,
title = {Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset},
author = {Zhuqian Zhou and Kirk Vanacore and Bakhtawar Ahtisham and Jinsook Lee and Doug Pietrzak and Daryl Hedley and Jorge Dias and Chris Shaw and Ruth Schäfer and René F. Kizilcec},
journal= {arXiv preprint arXiv:2602.16571},
year = {2026}
}