透明NLP:使用RAG和LLM对齐进行隐私问答
计算与语言
2025-02-11 v1
摘要
通用数据保护条例(GDPR)的透明原则要求数据处理信息应清晰、准确且可访问。尽管语言模型在该领域显示出前景,但其概率性质使得真实性和可理解性复杂化。本文检讨了经过增强的检索增强生成(Retrieval-Augmented Generation, RAG)系统,集成了对齐技术以满足GDPR义务。我们评估包括对齐模块如可重播自回归推理(Rewindable Auto-regressive Inference, RAIN)和我们提出的多维扩展(MultiRAIN)的RAG系统,使用隐私问答数据集。响应经过优化以实现精确性和可理解性,并通过21项指标进行评估,包括确定性和大型语言模型基于的评估。我们的结果显示,集成对齐模块的RAG系统在大多数指标上优于基线RAG系统,但没有一个完全匹配人类答案。结果的主成分分析揭示了指标之间的复杂相互作用,突显了细化指标的必要性。这一研究为将先进的自然语言处理系统集成到法律合规框架中提供了基础。
引用
@article{arxiv.2502.06652,
title = {Transparent NLP: Using RAG and LLM Alignment for Privacy Q&A},
author = {Anna Leschanowsky and Zahra Kolagar and Erion Çano and Ivan Habernal and Dara Hallinan and Emanuël A. P. Habets and Birgit Popp},
journal= {arXiv preprint arXiv:2502.06652},
year = {2025}
}
备注
Submitted to ARR