中文

面向情境感知的本地语言模型自适应隐私化

人工智能 2026-01-22 v1

摘要

定性研究常包含个人、情境和组织细节,如果处理不当会带来隐私风险。手动匿名化耗时、一致性差,常常遗漏关键识别符。现有自动化工具倾向于依赖模式匹配或固定规则,无法捕捉情境信息,可能改变数据的含义。本研究使用本地 LLM 构建一个可靠、可重复且情境感知的匿名化流程,用于检测和匿名化定性记录中的敏感数据。我们引入了一个结构化自适应匿名器框架(SFAA),包括检测、分类和自适应匿名化三个步骤。SFAA 包含四种匿名化策略:基于规则的替换、情境感知重写、概括化和抑制。根据标识符类型和风险等级应用这些策略。由 SFAA 处理的标识符依据主要国际隐私和研究伦理标准(包括 GDPR、HIPAA 和 OECD 指南)进行指导。本研究遵循双方法评估,将人工处理与 LLM 辅助处理相结合。使用两个案例研究进行评估。第一个包括 82 份面对面访谈,关于组织中的游戏化。第二个涉及 93 份由 AI 智能访谈者进行的机器人访谈,用于测试 LLM 的意识和工作场所隐私。我们使用 LLaMA 和 Phi 两个本地模型来评估所提出框架的性能。结果表明,LLM 发现的数据比人类审阅员更多。Phi 在发现敏感数据方面优于 LLaMA,但会稍多出错。Phi 能够发现超过 91% 的敏感数据,并保持 94.8% 的情感与原文一致,这意味着它非常准确,因此不会影响对定性数据的分析。

关键词

引用

@article{arxiv.2601.14683,
  title  = {Local Language Models for Context-Aware Adaptive Anonymization of Sensitive Text},
  author = {Aisvarya Adeseye and Jouni Isoaho and Seppo Virtanen and Mohammad Tahir},
  journal= {arXiv preprint arXiv:2601.14683},
  year   = {2026}
}

备注

Accepted and Waiting to be Published. ICAI'25: 27th International Conference on Artificial Intelligence https://american-cse.org/csce2025/conferences-ICAI