PETLP:面向AI研究中社交媒体数据的隐私即设计流水线
多媒体
2025-10-17 v2 人工智能
数据库
摘要
社交媒体数据使AI研究人员在GDPR、版权法及平台条款下面临重叠的义务,然而现有框架未能整合这些监管领域,导致研究人员缺乏统一指导。我们提出PETLP(Privacy-by-design Extract, Transform, Load, and Present,隐私即设计提取、转换、加载与呈现),一种将法律保障措施直接嵌入扩展ETL流水线的合规框架。PETLP的核心是将数据保护影响评估视为从预注册到传播过程中不断演进的动态文档。通过对Reddit的系统分析,我们展示了合格研究机构(可援引DSU第3条以覆盖平台限制)与商业实体(受服务条款约束)之间的数据提取权存在根本差异,而GDPR义务则普遍适用。我们论证了为何真正的匿名化对社交媒体数据仍无法实现,并揭示了许可的数据集创建与不确定的模型分发之间的法律空白。通过将合规决策结构化为实用工作流并简化机构数据管理计划,PETLP使研究人员能够自信地应对监管复杂性,弥合法律要求与研究实践之间的差距。
引用
@article{arxiv.2508.09232,
title = {PETLP: A Privacy-by-Design Pipeline for Social Media Data in AI Research},
author = {Nick Oh and Giorgos D. Vrakas and Siân J. M. Brooke and Sasha Morinière and Toju Duke},
journal= {arXiv preprint arXiv:2508.09232},
year = {2025}
}
备注
Extended version of paper to appear in the 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2025)