中文

GenAIPABench:基于生成式 AI 的隐私助手基准测试

密码学与安全 2023-12-20 v3 计算机与社会

摘要

网站的隐私政策通常冗长且复杂。隐私助手有助于简化政策并使其更易获取、对用户更友好。生成式 AI(genAI)的出现为构建能够回答用户关于隐私政策问题的隐私助手提供了新机遇。然而,genAI 的可靠性令人担忧,因其可能产生不准确信息。本研究引入 GenAIPABench,一个用于评估基于生成式 AI 的隐私助手(GenAIPAs)的基准。GenAIPABench 包括:1)一组关于隐私政策和数据保护法规的问题,带有针对各类组织和法规的标注答案;2)评估回答准确性、相关性与一致性的指标;3)一个用于生成提示以引入隐私文档和多样化隐私问题、测试系统鲁棒性的工具。我们使用 GenAIPABench 评估了三个领先的 genAI 系统 ChatGPT-4、Bard 和 Bing AI,以衡量其作为 GenAIPAs 的有效性。我们的结果展示了 genAI 在隐私领域的显著潜力,同时也凸显了在处理复杂查询、确保一致性和核实来源准确性方面的挑战。

关键词

引用

@article{arxiv.2309.05138,
  title  = {GenAIPABench: A Benchmark for Generative AI-based Privacy Assistants},
  author = {Aamir Hamid and Hemanth Reddy Samidi and Tim Finin and Primal Pappachan and Roberto Yus},
  journal= {arXiv preprint arXiv:2309.05138},
  year   = {2023}
}