SafeGen:嵌入伦理安全措施的文本到图像生成
人工智能
2025-12-16 v1
摘要
生成式人工智能创造了前所未有的创作表达、教育和研究机会。文本到图像系统如 DALL.E、Stable Diffusion 和 Midjourney 已能在几秒钟内将想法转化为图像,但也带来了双重用途的困境,引发关键伦理关切:放大社会偏见、产生高保真虚假信息以及侵犯知识产权。本文介绍 SafeGen,一个将伦理安全措施直接嵌入文本到图像生成管道的框架,依据可信赖 AI 的既定原则进行设计。SafeGen 集成了两个互补组件:BGE-M3,一个微调后的文本分类器,用于过滤有害或误导性提示;以及 Hyper-SD,一个优化扩散模型,能够生成高保真、语义对齐的图像。基于精选的多语言(英-越)数据集和公平性感知的训练过程,SafeGen 证明了在单一工作流程中可以实现创造自由与伦理责任的调和。定量评估确认了其有效性,Hyper-SD 实现了 IS=3.52、FID=22.08 和 SSIM=0.79,BGE-M3 达到 F1-Score=0.81。消融研究进一步验证了针对两个模块进行领域特定微调的重要性。案例研究说明 SafeGen 在阻止不安全提示、生成包容性教学材料以及强化学术诚信方面的实际影响。
引用
@article{arxiv.2512.12501,
title = {SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation},
author = {Dang Phuong Nam and Nguyen Kieu and Pham Thanh Hieu},
journal= {arXiv preprint arXiv:2512.12501},
year = {2025}
}