中文

DOMR:通过稠密对象匹配建立跨视图分割

计算机视觉与模式识别 2025-08-07 v1

摘要

跨视图对象对应涉及将对象在本体(first-person)视图与外源(third-person)视图之间匹配,是视觉理解的关键且具挑战性的任务。本文提出稠密对象匹配与细化(DOMR)框架以建立跨视图的稠密对象对应。该框架核心为稠密对象匹配器(DOM)模块,联合建模多个对象。不同于直接将单个对象掩码匹配到图像特征的方法,DOM利用位置和语义关系寻找对应物。DOM集成了 proposal 生成模块与稠密匹配模块,联合编码视觉、空间和语义线索,显式构建对象间关系以实现对象间的稠密匹配。进一步将DOM与掩码细化头结合,提高预测掩码的完整性和准确性,形成完整的DOMR框架。广泛评估表明,我们的方法在Ego-Exo4D基准上实现了最先进的性能,在Ego→Exo上达到49.7%的平均IoU,在Exo→Ego上达到55.2%,分别超过前方法5.8%和4.3%,验证了我们集成方法在跨视图理解方面的有效性。

关键词

引用

@article{arxiv.2508.04050,
  title  = {DOMR: Establishing Cross-View Segmentation via Dense Object Matching},
  author = {Jitong Liao and Yulu Gao and Shaofei Huang and Jialin Gao and Jie Lei and Ronghua Liang and Si Liu},
  journal= {arXiv preprint arXiv:2508.04050},
  year   = {2025}
}

备注

Accepted by ACM MM 2025