Stylistic-STORM(ST-STORM):感知外观的语义本质
计算机视觉与模式识别
2026-04-20 v1 人工智能
机器学习
机器学习
摘要
自监督学习(SSL)中的一种主导范式,如 MoCo 或 DINO,旨在通过捕获对特定图像变换(如照明或几何变化)不敏感的特征来产生稳健的表征。当目标是独立于外观识别物体时,这一策略是合适的。但只要外观本身构成判别信号,这一策略就变得适得其反。在天气分析中,雨纹、雪粒、大气散射以及反射和光晕并非噪声:它们携带着至关重要的信息。在自动驾驶等关键应用中,忽略这些线索是危险的,因为抓地力和能见度直接取决于路面状况和大气条件。我们引入 ST-STORM,一种混合 SSL 框架,将外观(风格)视为需要与内容分离的语义模态。我们的架构显式分离两个潜在流,由门控机制调节。内容分支通过 JEPA 框架耦合对比目标,促进对外观变化的不变性。在此基础上,风格分支在对抗约束下,通过特征预测和重建来捕获外观特征(纹理、对比度、散射)。我们在多个任务上评估了 ST-STORM,包括对象分类(ImageNet-1K)、细粒度天气特征化以及黑色素瘤检测(ISIC 2024 挑战赛)。结果表明,风格分支有效隔离了复杂的外观现象(在 Multi-Weather 上 F1=97%,ISIC 2024 上 F1=94%,仅使用 10% 标注数据),且未降低内容分支在 ImageNet-1K 上的语义性能(F1=80%),并改进了对关键外观的保留。
引用
@article{arxiv.2604.16086,
title = {Stylistic-STORM (ST-STORM) : Perceiving the Semantic Nature of Appearance},
author = {Hamed Ouattara and Pierre Duthon and Pascal Houssam Salmane and Frédéric Bernardin and Omar Ait Aider},
journal= {arXiv preprint arXiv:2604.16086},
year = {2026}
}
备注
20 pages, 16 figures, ICPR 2026 (28th International Conference on Pattern Recognition)