中文

通过双模态因果干预实现鲁棒的以自我为中心的指代视频对象分割

计算机视觉与模式识别 2026-01-01 v1

摘要

以自我为中心的指代视频对象分割(Ego-RVOS)旨在根据语言查询的描述,在第一人称视频中分割出主动参与人类动作的特定对象。此任务对于理解以自我为中心的人类行为至关重要。然而,由于以自我为中心的视频中固有的模糊性以及训练数据中存在的偏差,实现鲁棒的分割具有挑战性。因此,现有方法通常难以应对,它们从数据集中倾斜的对象-动作配对以及以自我为中心视角的基本视觉混杂因素(如快速运动和频繁遮挡)中学习到虚假相关性。为了解决这些局限性,我们引入了因果自我指代分割(CERES),这是一个即插即用的因果框架,可将强大的预训练 RVOS 骨干网络适配到以自我为中心的领域。CERES 实现了双模态因果干预:应用后门调整原则来抵消从数据集统计中学习的语言表示偏差,并利用前门调整概念,通过因果原则引导,智能地将语义视觉特征与几何深度信息融合,从而解决视觉混杂问题,创建对以自我为中心的失真更鲁棒的表示。大量实验表明,CERES 在 Ego-RVOS 基准测试上达到了最先进的性能,突显了应用因果推理为更广泛的以自我为中心的视频理解构建更可靠模型的潜力。

关键词

引用

@article{arxiv.2512.24323,
  title  = {Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention},
  author = {Haijing Liu and Zhiyuan Song and Hefeng Wu and Tao Pu and Keze Wang and Liang Lin},
  journal= {arXiv preprint arXiv:2512.24323},
  year   = {2026}
}

备注

NeurIPS 2025