LLM应用生态系统中数据收集的深度调查
密码学与安全
2025-05-22 v2 人工智能
计算与语言
计算机与社会
机器学习
摘要
LLM应用(工具)生态系统正在迅速发展,以支持通常需要大量用户数据收集的复杂用例。鉴于LLM应用由第三方开发,且轶事证据表明LLM平台的政策执行不一致,与这些应用共享用户数据会带来显著的隐私风险。在本文中,我们旨在提高LLM应用生态系统数据实践的透明度。我们以OpenAI的GPT应用生态系统作为案例研究。我们提出了一个基于LLM的框架来分析GPT Actions(自定义工具)的自然语言规范,并评估其数据收集实践。我们的分析显示,Actions在24个类别和145种数据类型中收集了过多的数据,其中第三方Actions平均多收集6.03%的数据。我们发现,一些Actions违反了OpenAI的政策,收集了敏感信息,例如密码,这是OpenAI明确禁止的。最后,我们开发了一个基于LLM的隐私政策分析框架,以自动检查Actions的数据收集与其隐私政策中的披露之间的一致性。我们的测量表明,大多数收集的数据类型的披露被省略,只有5.8%的Actions明确披露了其数据收集实践。
引用
@article{arxiv.2408.13247,
title = {An In-Depth Investigation of Data Collection in LLM App Ecosystems},
author = {Yuhao Wu and Evin Jaff and Ke Yang and Ning Zhang and Umar Iqbal},
journal= {arXiv preprint arXiv:2408.13247},
year = {2025}
}
备注
Accepted by the ACM Internet Measurement Conference (IMC) 2025