用于冻结视觉基础模型中表示一致性的维度共激活
计算机视觉与模式识别
2026-05-12 v1 图像与视频处理
信号处理
摘要
冻结的视觉基础模型不仅提取特征;它们通过学习的坐标系统组织图像。我们提出了表示一致性问题:冻结的基础模型是否在单个输入的内部语义子区域之间保持一致的表示。这引出了维度共激活 (Dimensional Coactivation, DCA):一种用于衡量这种一致性的每个维度工具。DCA 通过询问相同特征维度在语义子区域之间是否共激活来进行比较。与经典相似性度量不同,它刻意避免中心化、L2 归一化和完整 Gram 耦合。这些操作在比较不同模型或分布时有用,但它们不匹配于单样本内情境,因为坐标系固定且原始幅度携带信号。深度伪造检测提供了自然的验证任务。合成人脸可能再现出 plausible 的眼睛、鼻子和嘴巴,同时打破真实人脸中这些区域之间的表示结构。使用冻结的 DINOv3 特征,DCA 揭示了这一破坏:眼-鼻-嘴指纹在 CelebDF-v2 上实现 0.9106 AUC,在 DFD 下实现 0.9289。设计也通过消融实验得到锐利验证:重新引入中心化使 CelebDF-v2 的 AUC 降至 0.459,L2 归一化将其降至 0.862,跨维度耦合将其降至 0.478。最后,用 FaRL 替代 DINOv3 将 CelebDF-v2 的 AUC 降至 0.582。因此,DCA 依赖于稳定的每个维度坐标系,而不仅仅是区域提取。这些结果将 DCA 定位为冻结基础模型中用于衡量单样本表示一致性的仪器,深度伪造检测作为首个验证任务。
引用
@article{arxiv.2605.08249,
title = {Dimensional Coactivation for Representational Consistency in Frozen Vision Foundation Models},
author = {Izaldein Al-Zyoud Abdulmotaleb El Saddik},
journal= {arXiv preprint arXiv:2605.08249},
year = {2026}
}