OVERT:文本到图像模型的过度拒绝评估基准
机器学习
2025-10-28 v3
摘要
文本到图像(T2I)模型在从文本输入生成视觉内容方面取得了显著成功。尽管已提出多种安全对齐策略以防止有害输出,但它们通常会导致过度谨慎的行为——甚至拒绝良性提示——这种现象被称为 ,降低了 T2I 模型的实用性。尽管过度拒绝在实践中已被观察到,但目前尚无大规模基准来系统评估 T2I 模型的这一现象。在本文中,我们提出了一个自动工作流来构建合成评估数据,生成了 OVERT(r-efusal evaluation on ext-to-image models,文本到图像模型的过度拒绝评估),这是首个用于评估 T2I 模型过度拒绝行为的大规模基准。OVERT 包含跨九个安全相关类别的 4,600 个看似有害但实为良性的提示,以及 1,785 个真正有害的提示(OVERT-unsafe),以评估安全性与实用性之间的权衡。使用 OVERT,我们评估了多个领先的 T2I 模型,发现过度拒绝是跨各类别的普遍问题(图 1),凸显了在不损害 T2I 模型功能的前提下进一步加强其安全对齐的研究需求。作为减少过度拒绝的初步尝试,我们探索了提示重写;然而我们发现这通常会偏离原始提示含义的忠实度。最后,我们通过生成适应用户自定义策略的定制评估数据,展示了我们生成框架在适应多样化安全需求方面的灵活性。
引用
@article{arxiv.2505.21347,
title = {OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models},
author = {Ziheng Cheng and Yixiao Huang and Hui Xu and Somayeh Sojoudi and Xuandong Zhao and Dawn Song and Song Mei},
journal= {arXiv preprint arXiv:2505.21347},
year = {2025}
}
备注
NeurIPS 2025 (D&B Track)