Le Cam 失真:面向鲁棒迁移学习的决策论框架
机器学习
2025-12-30 v1 人工智能
统计理论
统计方法学
机器学习
统计理论
摘要
分布迁移是现实机器学习的核心挑战。主导范式——无监督域适应(UDA)——通过对称散度最小化强制特征不变性,将源域和目标域表示对齐 [Ganin 等,2016]。我们证明这一方法本质上存在缺陷:当域信息不平等(例如高质量传感器与降级传感器)时,严格的特征不变性要求信息被破坏,从而导致“负迁移”,在安全关键应用中可能造成灾难性后果 [Wang 等,2019]。我们提出一种基于 Le Cam 统计实验理论 [Le Cam,1986] 的决策论框架,通过构造近似方法将对称不变性替换为方向可模拟性。我们引入 Le Cam 失真,通过 Deficiency Distance δ(E₁, E₂) 量化,作为可模拟性条件下的迁移风险的严格上界。我们的框架通过学习一种模拟从源域生成目标域的核函数,实现无源域降级的迁移。在五项实验(基因组学、计算机视觉、强化学习)中,Le Cam 失真实现了:(1)HLA 基因组学中接近完美的频率估计(相关系数 r=0.999,匹配经典方法),(2)CIFAR-10 图像分类中零源域效用损失(准确率保持 81.2%,而 CycleGAN 仅为 34.7%),以及(3)在强化学习控制中实现安全策略迁移,而基于不变性的方法则遭遇灾难性崩溃。Le Cam 失真为在负迁移不可接受的领域(医学影像、自动驾驶、精密医学)提供了首个原则化的风险控制迁移学习框架。
引用
@article{arxiv.2512.23617,
title = {Le Cam Distortion: A Decision-Theoretic Framework for Robust Transfer Learning},
author = {Deniz Akdemir},
journal= {arXiv preprint arXiv:2512.23617},
year = {2025}
}