解耦内容与风格以克服捷径学习:混合生成-判别学习框架
计算机视觉与模式识别
2025-09-23 v3 机器学习
摘要
尽管自监督学习(SSL)取得了显著成功,但其泛化能力从根本上受到捷径学习的制约——模型利用纹理等表面特征而非内在结构。我们在生成范式(如 MAE)中实验验证了这一缺陷,并论证这也是影响判别方法的系统性问题,将其识别为在未见域上失败的根本原因。现有方法通常仅在表面层面通过对齐或分离域特定特征来处理此问题,但未能改变助长捷径依赖的底层学习机制。为从根本上解决此问题,本文提出 HyGDL(混合生成-判别学习框架),一种实现显式内容-风格解耦的混合框架。我们的方法受不变性预训练原则指导:通过系统地在输入中变化偏差(如风格)同时保持监督信号不变,迫使模型学习不变的本质。HyGDL 在单一编码器上运行,并通过向量投影解析地将风格定义为表示中与其风格不变内容正交的分量。这通过协同设计实现:(1)自蒸馏目标学习稳定且风格不变的内容方向;(2)解析投影随后将表示分解为正交的内容向量和风格向量;(3)风格条件重建目标利用这些向量恢复图像,提供端到端监督。与依赖隐式启发式方法的前人工作不同,这种原则性的解耦使 HyGDL 能够学习真正鲁棒的表示,在诊断捷径学习的基准测试中展现出优越性能。
引用
@article{arxiv.2509.11598,
title = {Disentangling Content from Style to Overcome Shortcut Learning: A Hybrid Generative-Discriminative Learning Framework},
author = {Siming Fu and Sijun Dong and Xiaoliang Meng},
journal= {arXiv preprint arXiv:2509.11598},
year = {2025}
}