CI-Bench:基于合成数据的 AI 助手上下文完整性基准测试
人工智能
2024-09-24 v1
摘要
生成式 AI 的进步指向了一个新时代,即代表用户执行各种任务的个性化应用。尽管通用 AI 助手尚未完全成熟,但其共享个人数据的潜力引发了重大的隐私挑战。本文介绍了 CI-Bench,这是一个全面的合成基准,用于评估 AI 助手在模型推理期间保护个人信息的能力。利用上下文完整性(Contextual Integrity)框架,我们的基准能够跨重要的上下文维度(包括角色、信息类型和传输原则)对信息流进行系统性评估。我们提出了一种新颖、可扩展的多步合成数据流水线,用于生成自然通信,包括对话和电子邮件。与以往规模较小、范围狭窄的评估不同,我们提出了一种新颖、可扩展的多步数据流水线,以合成方式生成自然通信(包括对话和电子邮件),并借此在八个领域中生成了 44,000 个测试样本。此外,我们构建并评估了一个朴素的 AI 助手,以证明进一步研究以及针对个人助手任务进行谨慎训练的必要性。我们期望 CI-Bench 成为指导未来语言模型开发、部署、系统设计和数据集构建的宝贵工具,最终促进开发出符合用户隐私期望的 AI 助手。
引用
@article{arxiv.2409.13903,
title = {CI-Bench: Benchmarking Contextual Integrity of AI Assistants on Synthetic Data},
author = {Zhao Cheng and Diane Wan and Matthew Abueg and Sahra Ghalebikesabi and Ren Yi and Eugene Bagdasarian and Borja Balle and Stefan Mellem and Shawn O'Banion},
journal= {arXiv preprint arXiv:2409.13903},
year = {2024}
}