面向脆弱人群的 LLM 合成文本生成的原则性管控:PromptGuard 框架
计算与语言
2025-09-12 v1
摘要
大型语言模型 (LLM) 在现实应用中的普及带来了前所未有的风险,可能生成针对 LGBTQ+ 成员、单亲家庭以及被边缘化社区的有害、偏见或误导信息。虽然现有安全方法依赖事后过滤或通用对齐技术,但它们无法在生成源头主动防止有害输出。本文引入 PromptGuard,一种新的模块化提示框架,其突破性贡献为 VulnGuard 提示技术,这种混合技术通过基于真实世界数据驱动的对比学习防止有害信息生成。VulnGuard 集成来自精选 GitHub 存储库中的零样本示例、伦理链式推理以及自适应角色提示,创建面向特定人群的保护性屏障。该框架采用理论上的多目标优化,经过形式化证明,显示通过熵边界和帕累托最优性可实现 25-30% 的分析性伤害减少。PromptGuard 编排六个核心模块:输入分类、VulnGuard 提示、伦理原则集成、外部工具交互、输出验证和用户-系统交互,为实时伤害预防构建了一个智能专家系统。我们提供了包括收敛性证明、基于信息论的脆弱性分析以及基于 GitHub 数据集的理论验证框架在内的全面数学形式化,确立了系统性经验研究的数学基础。
引用
@article{arxiv.2509.08907,
title = {Automated Evidence Extraction and Scoring for Corporate Climate Policy Engagement: A Multilingual RAG Approach},
author = {Imene Kolli and Ario Saeid Vaghefi and Chiara Colesanti Senni and Shantam Raj and Markus Leippold},
journal= {arXiv preprint arXiv:2509.08907},
year = {2025}
}