Privasis:从零构建规模为百万级的“公共”私有数据集
计算与语言
2026-02-04 v1 人工智能
摘要
涉及隐私敏感数据的研究始终受数据稀缺的限制,这与其他受数据规模红利驱动的领域形成鲜明对比。随着现代AI智能体(如OpenClaw和Gemini Agent)获得对高度敏感个人信息的持久访问权限,这一挑战正日益迫切。为破解这一长期瓶颈并应对日益增加的风险,我们提出Privasis(即隐私浴漫),这是第一个从零构建的规模为百万级的完全合成数据集——一个包含丰富且多样化私人信息文本的大型资源库,旨在拓宽和加速那些不可避免要处理敏感社交数据的研究领域。与现有数据集相比,Privasis包含140万条记录,规模、质量和多样性远超前沿数据集,涵盖医疗史、法律文件、财务记录、日历和短信等多种文档类型,总计5510万个标注属性,如族裔、出生日期、职场等。我们利用Privasis构建了用于文本消除的平行语料库,采用我们的管道将文本分解并施加针对性消除。我们的紧凑型消除模型(参数≤40亿)在该数据集上训练后,超越了如GPT-5和Qwen-3 235B等最先进的大语言模型。我们计划发布数据、模型和代码,以加速未来在隐私敏感领域和智能体方面的研究。
引用
@article{arxiv.2602.03183,
title = {Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch},
author = {Hyunwoo Kim and Niloofar Mireshghallah and Michael Duan and Rui Xin and Shuyue Stella Li and Jaehun Jung and David Acuna and Qi Pang and Hanshen Xiao and G. Edward Suh and Sewoong Oh and Yulia Tsvetkov and Pang Wei Koh and Yejin Choi},
journal= {arXiv preprint arXiv:2602.03183},
year = {2026}
}
备注
For code and data, see https://privasis.github.io