SwordBench:评估图像表示的正交性
计算机视觉与模式识别
2026-05-19 v1 人工智能
机器学习
摘要
在推理时对模型表示进行干预以纠正预测对于 AI 可解释性和安全性至关重要,但现有评估协议仅限于模糊的语言建模任务。为填补这一空白,我们引入 SwordBench,这是一个用于评估视觉模型图像表示正交性的基准,涵盖多个 backbone 和概念消除任务。除了统一的基准测试套件,我们提出了新的评估概念,揭示概念激活向量正交化的二阶效应。具体而言,cross-concept robustness 测量对输入进行正交化处理后,对 alternative concepts 上概念检测性能的稳定性;collateral damage 则衡量干预是否意外影响缺乏偏见的输入在下游任务上的性能。在我们发现尽管线性支持向量机在可分离性和正交性方面表现优越,但未能实现零 collateral damage,常常落后于稀疏自编码器。在简单场景中,标准基线和基于优化的方法均未能实现完美的 steering。源代码将很快在 GitHub 上公开。
引用
@article{arxiv.2605.16372,
title = {SwordBench: Evaluating Orthogonality of Steering Image Representations},
author = {Vladimir Zaigrajew and Dawid Pludowski and Hubert Baniecki and Przemyslaw Biecek},
journal= {arXiv preprint arXiv:2605.16372},
year = {2026}
}