中文

语义引导的动作预测

计算机视觉与模式识别 2025-10-16 v4 人工智能 机器学习

摘要

无监督域适应仍是实现模型跨不可见域知识迁移的关键挑战。现有方法在保持域特定特征的同时平衡域不变表示的需求方面受到挑战,这往往是由于将具有相似语义的样本在潜空间中强制接近 despite 其在域上的巨大差异所致。我们引入了一种新方法,转变焦点从在绝对坐标系中对齐表示到对齐潜空间中等效概念的相对位置。我们的 method 定义了语义/几何关系在语言空间中的 domain-agnostic 结构,并引导适应,确保视觉空间中样本的组织反映参考 inter-class 关系,同时保持域特定特征。我们经验性地演示了该方法在域适应任务中的优越性,涵盖四个 diverse 的图像和视频数据集。值得注意的是,我们在四个 diverse 的图像和视频数据集上的 18 种不同的适应场景中超越了之前的工作,在 DomainNet 上实现了 +3.32% 的平均准确率提升,在 GeoPlaces 上实现 +5.75% 的提升,在 GeoImnet 上实现 +4.77% 的提升,在 EgoExo4D 上实现 +1.94% 的平均类别准确率提高。

关键词

引用

@article{arxiv.2411.15557,
  title  = {Semantically Guided Action Anticipation},
  author = {Anxhelo Diko and Antonino Furnari and Luigi Cinque and Giovanni Maria Farinella},
  journal= {arXiv preprint arXiv:2411.15557},
  year   = {2025}
}