面向合规提取处理活动:基于 few-shot 学习的方法
软件工程
2024-08-07 v1
摘要
移动应用的广泛使用推动了该行业的增长,企业高度依赖用户数据提供定向广告和个性化服务。在此背景下,像通用数据保护条例(GDPR)这样的隐私法规发挥着关键作用。GDPR 要求企业维护处理活动记录(Record of Processing Activities, RoPA)。RoPA 包括数据处理活动的描述、其目的、涉及的数据类型以及其他相关外部实体。小型 app 开发公司因资源有限和时间紧迫,在满足此类合规要求方面面临挑战。为帮助这些开发者并防止处罚,我们提出了一种方法,通过大型语言模型(LLMs)从用户撰写的使用场景生成 RoPA 的片段。我们的方法使用 GPT-3.5 Turbo 进行 few-shot 学习,以总结使用场景并生成 RoPA 片段。我们评估了影响 few-shot 学习性能一致性的不同因素,包括 few-shot 提示中示例的数量、重复次数以及示例的顺序置换。我们的发现表明,提示中示例的数量对总结的 F1 分数有显著影响,而多个提示重复的 F1 分数几乎没有变异。我们的提示实现了平均 70% 的 ROUGE-L F1 分数的成功总结。最后,我们讨论了通过对生成摘要进行人工评估来提高结果的可能性。
引用
@article{arxiv.2407.09592,
title = {Toward Regulatory Compliance: A few-shot Learning Approach to Extract Processing Activities},
author = {Pragyan KC and Rambod Ghandiparsi and Rocky Slavin and Sepideh Ghanavati and Travis Breaux and Mitra Bokaei Hosseini},
journal= {arXiv preprint arXiv:2407.09592},
year = {2024}
}
备注
Accepted in the the 11th International Workshop on Evolving Security & Privacy Requirements Engineering (ESPRE)