评估人工智能技术在文本匿名化中的效能:一项比较研究
计算与语言
2024-05-14 v1 人工智能
摘要
在数字时代,随着隐私问题的日益加剧,设计既能保护私有数据又能保持文本信息内在价值的鲁棒策略变得至关重要。本研究对文本匿名化方法进行了全面考察,重点关注条件随机场(CRF)、长短期记忆网络(LSTM)、语言模型嵌入(ELMo)以及Transformer架构的变革性能力。每种模型都展现出独特的优势:LSTM擅长建模长期依赖关系,CRF捕捉词序列间的依赖关系,ELMo利用深度双向语言模型提供上下文相关的词表示,而Transformer引入了提供增强可扩展性的自注意力机制。我们的研究定位为对这些模型的比较分析,强调它们在应对文本匿名化挑战中的协同潜力。初步结果表明,CRF、LSTM和ELMo各自的表现均优于传统方法。将Transformer与其他模型一同比较,为在当代环境中实现最优文本匿名化提供了更广阔的视角。
引用
@article{arxiv.2405.06709,
title = {Evaluating the Efficacy of AI Techniques in Textual Anonymization: A Comparative Study},
author = {Dimitris Asimopoulos and Ilias Siniosoglou and Vasileios Argyriou and Sotirios K. Goudos and Konstantinos E. Psannis and Nikoleta Karditsioti and Theocharis Saoulidis and Panagiotis Sarigiannidis},
journal= {arXiv preprint arXiv:2405.06709},
year = {2024}
}