释放大型语言模型在临床文本匿名化中的潜力:一项比较研究
计算与语言
2024-06-05 v1 人工智能
密码学与安全
机器学习
摘要
自动化临床文本匿名化有潜力在确保患者隐私和安全的同时,解锁文本健康数据的广泛共享以用于二次使用。尽管文献中提出了许多复杂且理论上成功的匿名化解决方案,但这些技术仍然存在缺陷。因此,临床机构仍然不愿将其应用于数据的开放访问。大型语言模型(LLM)的最新进展为推进该领域提供了有希望的机会,因为它们能够执行各种任务。本文提出了六种新的评估指标,专门针对基于LLM的生成式匿名化的挑战。此外,我们对基于LLM的方法进行了比较研究,将它们与两种基线技术进行了对比测试。我们的结果确立了基于LLM的模型作为常见方法的可靠替代方案,为临床文本的可信匿名化铺平了道路。
引用
@article{arxiv.2406.00062,
title = {Unlocking the Potential of Large Language Models for Clinical Text Anonymization: A Comparative Study},
author = {David Pissarra and Isabel Curioso and João Alveira and Duarte Pereira and Bruno Ribeiro and Tomás Souper and Vasco Gomes and André V. Carreiro and Vitor Rolla},
journal= {arXiv preprint arXiv:2406.00062},
year = {2024}
}