中文

当目标数据有限时:基于多自适应起点的半监督域适应理论

机器学习 2025-07-22 v1 机器学习 统计理论 统计理论

摘要

半监督域适应(SSDA)旨在通过利用丰富的源数据和未标记的目标数据,在目标域中实现高预测性能。尽管该方法在众多应用中具有重要意义,但关于 SSDA 方法有效性的理论研究仍属未探索范畴,尤其是在涉及各种类型源-目标分布迁移的场景下。本文基于结构因果模型(SCM)构建了理论框架,使我们能够在目标数据有限的情况下分析和量化 SSDA 方法的性能。该框架内,我们引入三种 SSDA 方法,每种方法都针对关于源与目标关系的不同假设进行微调策略。针对每种假设,我们展示了如何将无监督域适应(UDA)方法扩展到 SSDA,以在有限目标标签下实现 minimax 最优的目标性能。当源与目标数据之间的关系仅略知其晦,——这是一种常见的实际关切——我们提出了多自适应起点微调(MASFT)算法,该算法从多个起始点对 UDA 模型进行微调,并根据小型目标验证数据集选择表现最好的一个。结合模型选择保证,MASFT 在广泛的分布迁移类型范围内实现接近最优的目标预测性能,同时显著降低了对标记目标数据的需求。我们通过仿真实验验证了所提方法的有效性。

关键词

引用

@article{arxiv.2507.14661,
  title  = {When few labeled target data suffice: a theory of semi-supervised domain adaptation via fine-tuning from multiple adaptive starts},
  author = {Wooseok Ha and Yuansi Chen},
  journal= {arXiv preprint arXiv:2507.14661},
  year   = {2025}
}