中文

勿忘私有检索:面向大语言模型的分布式私有相似度搜索

信息检索 2023-11-23 v1

摘要

尽管大语言模型(LLMs)的灵活能力使其能基于已有学习知识回答一系列查询,但用于增强生成的信息检索是一项重要工具,可使LLMs回答预训练数据中未包含的信息相关问题。此类私有信息正日益由组织和个人在广泛的分布式环境中产生。使用查询与文档的神经嵌入进行此类信息检索,总会泄露查询与数据库内容的信息,除非二者均本地存储。我们提出私有检索增强生成(PRAG),一种利用多方计算(MPC)将查询安全传输至包含私有构建数据库的分布式服务器集合以返回top-k与近似top-k文档的方法。这是首个确保无任何服务器观测到客户端查询或能看到数据库内容的稠密信息检索方法。该方法引入了一种对MPC友好的倒排文件近似搜索(IVF)协议,可在亚线性通信复杂度下对分布式私有数据实现快速文档搜索。本工作开辟了新途径,使LLMs所用数据可在无需集中化或放弃隐私的情况下被访问与使用。

关键词

引用

@article{arxiv.2311.12955,
  title  = {Don't forget private retrieval: distributed private similarity search for large language models},
  author = {Guy Zyskind and Tobin South and Alex Pentland},
  journal= {arXiv preprint arXiv:2311.12955},
  year   = {2023}
}