中文

面向真实对话文本的PII遮盖轻量语言模型比较研究

计算与语言 2025-12-23 v1

摘要

自动遮盖个人可识别信息(PII)是隐私保护对话系统的关键需求。虽然当前主流大型语言模型在PII遮盖方面表现出强大的能力,但关于数据处理和计算成本的担忧促使我们探讨轻量模型是否能实现相当的性能。我们通过在AI4Privacy基准数据集上构建的英文数据集上,对T5-small和Mistral-Instruct-v0.3进行微调来比较编码器-解码器和解码器-only架构。我们创建了不同的数据集变体,以研究标签标准化和PII表示,覆盖24个标准化PII类别和更细粒度的设置。使用实体级别和字符级别指标、类型准确率和精确匹配进行评估,结果显示两种轻量模型在PII遮盖任务上达到与前沿LLM相当的性能。标签规范化在各种架构下均一致性地提高了性能。Mistral在F1和召回率上取得更高分数,跨PII类型的鲁棒性更好,但生成延迟显著更高。T5虽在对话文本中鲁棒性较差,但提供了更可控的结构化输出且推理成本更低,使其可用于Discord机器人中实现实际的PII红act。对实时消息的评估显示,在非正式输入下性能会下降。这些结果阐明了准确性、鲁棒性和计算效率之间的权衡,表明轻量模型可以在解决前沿LLM数据处理问题的同时,为PII遮盖提供有效解决方案。

关键词

引用

@article{arxiv.2512.18608,
  title  = {A Comparative Study of Light-weight Language Models for PII Masking and their Deployment for Real Conversational Texts},
  author = {Prabigya Acharya and Liza Shrestha},
  journal= {arXiv preprint arXiv:2512.18608},
  year   = {2025}
}