中文

RedacBench:AI 能否擦除你的秘密?

计算与语言 2026-03-24 v1 人工智能 密码学与安全

摘要

现代语言模型能够轻易从非结构化文本中提取敏感信息,这使得红acted(selective removal)成为数据安全的关键环节。然而,现有的红acted benchmark 通常只关注预定义的数据类别(如个人可识别信息,PII),或评估特定技术(如掩码)。为克服这一限制,我们引入 RedacBench,这是一个用于评估在不同领域和策略下基于策略条件的红acted 的综合性 benchmark。该 benchmark 由 514 篇由人类撰写的文本构成,涵盖个人、企业和政府来源,配以 187 项安全政策。RedacBench 测量模型 selectively 移除政策违规信息的能力,同时保留原始语义。我们通过 8,053 项标注命题量化了性能,该量化既衡量安全——即敏感命题的移除——也衡量实用性——即非敏感命题的保留。在多种红acted 策略和最先进的语言模型上进行实验,结果表明尽管更高级的模型能够提高安全性,但在保持实用性方面仍面临挑战。为促进未来研究,我们发布了 RedacBench 及其 web 基的玩具场(playground),用于数据集定制和评估。地址:https://hyunjunian.github.io/redaction-playground/。

关键词

引用

@article{arxiv.2603.20208,
  title  = {RedacBench: Can AI Erase Your Secrets?},
  author = {Hyunjun Jeon and Kyuyoung Kim and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2603.20208},
  year   = {2026}
}