关于无监督域适应的困难性:最优学习者与信息论视角
机器学习
2025-07-10 v1 信息论
机器学习
math.IT
摘要
本文研究了在协变量漂移下进行无监督域适应(Unsupervised Domain Adaptation, UDA)的困难性。我们通过分布 对学习者所面临的不确定性进行建模,这些分布体现为地面三元组 的组合,我们称其为 UDA 类,其中 表示源分布与目标分布的配对, 表示分类器。我们将学习者的性能定义为整个目标域风险的平均值,考虑地面三元组随机性的影响。这种表述将源分布、目标分布与分类器耦合地结合在了地面真实情况中,与经典最坏情况分析不同,后者悲观地强调了困难但罕见的 UDA 实例的影响。在该表述下,我们精确刻画了最优学习者的性能。最优学习者的性能随后允许我们定义 UDA 类以及观察到的样本的学习难度。为量化此难度,我们引入了后验目标标签不确定性(Posterior Target Label Uncertainty, PTLU)这一信息论量,并从样本中推导出其经验估计(Empirical PTLU, EPTLU),其捕捉了目标域预测的不确定性。简而言之,PTLU 是在给定观察到的源样本和目标样本后,对地面分类器后验分布下,对目标域预测标签熵。通过证明该量能为任何学习者的风险提供下界,我们表明这些量可用于评估 UDA 学习的难度。我们提供了多个例子,说明相对于现有度量方法,PTLU 在评估 UDA 学习难度方面的优势。
引用
@article{arxiv.2507.06552,
title = {On the Hardness of Unsupervised Domain Adaptation: Optimal Learners and Information-Theoretic Perspective},
author = {Zhiyi Dong and Zixuan Liu and Yongyi Mao},
journal= {arXiv preprint arXiv:2507.06552},
year = {2025}
}
备注
Accepted at the 4th Conference on Lifelong Learning Agents (CoLLAs 2025)