中文

AspirinSum:基于方面保持效用的去标识化摘要框架

人工智能 2024-06-21 v1 计算与语言

摘要

由于大型语言模型 (LLM) 的快速发展,整个社区热衷于获取可用于训练 LLM 的任何文本数据。当前,大量网络文本数据被视为廉价的训练数据来源。然而,当人们尝试将 LLM 的能力扩展到个人相关领域(如医疗或教育)时,由于缺乏公开数据集,这些领域的 LLM 适配进展缓慢。缺乏公开数据集的原因是这些领域的数据通常包含个人敏感信息。为了遵守隐私法规,这些数据在发布前必须进行去标识化处理。过去有大量研究致力于图像或表格数据的去标识化,但针对文本数据的高效通用去标识化方法研究有限。大多数方法基于人工标注或预定义类别列表,难以适用于特定领域。本研究旨在开发一个可轻松适用于特定领域的文本去标识化框架,能够利用现有专家知识而无需额外人工标注。我们提出了一种基于方面的效用保持去标识化摘要框架 AspirinSum,通过学习对齐现有评论数据中的方面信息,能够高效地提取与个人敏感方面相关的子句,并通过替换为类似方面子句来去标识化。我们设想,去标识化后的文本可用于数据发布,从而发布用于下游任务的去标识化数据集。

关键词

引用

@article{arxiv.2406.13947,
  title  = {AspirinSum: an Aspect-based utility-preserved de-identification Summarization framework},
  author = {Ya-Lun Li},
  journal= {arXiv preprint arXiv:2406.13947},
  year   = {2024}
}