面向高级文本匿名化方法的基准测试:新型与传统方法的比较研究
计算与语言
2024-04-24 v1 人工智能
信息检索
摘要
在数据隐私领域,有效实现文本匿名化的能力至关重要。随着深度学习,特别是Transformer架构的兴起,越来越多的人关注利用这些先进模型来处理文本匿名化任务。本文提出了一项全面的基准测试研究,比较了基于Transformer的模型和大型语言模型(LLM)与传统架构在文本匿名化任务中的性能。我们利用CoNLL-2003数据集进行评估,该数据集以其稳健性和多样性而著称。我们的结果展示了每种方法的优势与不足,为现代方法与传统方法的有效性提供了清晰的视角。值得注意的是,虽然现代模型在捕捉语境细微差别方面表现出先进的能力,但某些传统架构仍保持着高水平的性能。这项工作旨在为研究人员选择最合适的模型以满足其匿名化需求提供指导,同时也为该领域的未来发展之路提供了启示。
引用
@article{arxiv.2404.14465,
title = {Benchmarking Advanced Text Anonymisation Methods: A Comparative Study on Novel and Traditional Approaches},
author = {Dimitris Asimopoulos and Ilias Siniosoglou and Vasileios Argyriou and Thomai Karamitsou and Eleftherios Fountoukidis and Sotirios K. Goudos and Ioannis D. Moscholios and Konstantinos E. Psannis and Panagiotis Sarigiannidis},
journal= {arXiv preprint arXiv:2404.14465},
year = {2024}
}