LatentDiff:将语义数据集比较扩展至数百万图像
计算机视觉与模式识别
2026-05-05 v1 机器学习
摘要
我们提出LatentDiff,一个直接作用于预训练视觉编码器潜在空间的可扩展语义数据集比较框架。通过将稀疏自编码器驱动的发生率测试与密度比估计相结合,LatentDiff 在计算成本低于基于标题方法的百分之几时,即可识别数据集之间的可解释语义差异。我们还引入了Noisy-Diff,一个捕获真实稀疏分布迁移的基准,旨在挑战现有方法。实验表明,LatentDiff 在准确率上取得优异成绩,且对极小比例图像(从5%到<1%)的语义差异具有鲁棒性。
引用
@article{arxiv.2605.00899,
title = {LatentDiff: Scaling Semantic Dataset Comparison to Millions of Images},
author = {James Flora and Kowshik Thopalli and Akshay R. Kulkarni and Weng-Keen Wong and Shusen Liu},
journal= {arXiv preprint arXiv:2605.00899},
year = {2026}
}
备注
17 pages, 6 figures