中文

PROBE:诊断被擦除文本到视频扩散模型中残余概念能力

机器学习 2026-03-24 v1 人工智能

摘要

文本到视频(T2V)扩散模型的概念擦除技术报告显著抑制敏感内容,但当前评估仅限于检查目标概念是否 absent于生成帧,视输出级抑制作为 representational removal的证据。我们引入PROBE,一种量化被擦除概念 \textit{再激活潜力}的诊断协议。在保持所有模型参数冻结的前提下,PROBE通过去噪重建目标结合新颖的潜在对齐约束(将恢复锚定到原始概念的时空结构)优化轻量级伪标记嵌入。我们作出三项贡献:(1)跨级评估框架,涵盖基于分类器的检测、语义相似性、时序再激活分析和人类验证;(2)在三个T2V架构、三个概念类别和三个擦除策略上进行系统实验,揭示所有测试方法均留有可测量的残余能力,其鲁棒性与干预深度相关;(3)识别出时序再激活,这是一种视频特有的失效模式,被压制的概念在帧之间逐渐复现,肉眼可见的帧级指标无法捕捉。这些发现表明当前擦除方法实现的是输出级抑制而非表征移除。我们发布该协议以支持可重复的安全审计。我们的代码可在 https://github.com/YiweiXie/PRObingBasedEvaluation 查阅。

关键词

引用

@article{arxiv.2603.21546,
  title  = {What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators},
  author = {Xinyu Zhang},
  journal= {arXiv preprint arXiv:2603.21546},
  year   = {2026}
}

备注

5 pages, 3 figures, 1 table