DOMR:通过稠密对象匹配建立跨视图分割
计算机视觉与模式识别
2025-08-07 v1
摘要
跨视图对象对应涉及将对象在本体(first-person)视图与外源(third-person)视图之间匹配,是视觉理解的关键且具挑战性的任务。本文提出稠密对象匹配与细化(DOMR)框架以建立跨视图的稠密对象对应。该框架核心为稠密对象匹配器(DOM)模块,联合建模多个对象。不同于直接将单个对象掩码匹配到图像特征的方法,DOM利用位置和语义关系寻找对应物。DOM集成了 proposal 生成模块与稠密匹配模块,联合编码视觉、空间和语义线索,显式构建对象间关系以实现对象间的稠密匹配。进一步将DOM与掩码细化头结合,提高预测掩码的完整性和准确性,形成完整的DOMR框架。广泛评估表明,我们的方法在Ego-Exo4D基准上实现了最先进的性能,在Ego→Exo上达到49.7%的平均IoU,在Exo→Ego上达到55.2%,分别超过前方法5.8%和4.3%,验证了我们集成方法在跨视图理解方面的有效性。
引用
@article{arxiv.2508.04050,
title = {DOMR: Establishing Cross-View Segmentation via Dense Object Matching},
author = {Jitong Liao and Yulu Gao and Shaofei Huang and Jialin Gao and Jie Lei and Ronghua Liang and Si Liu},
journal= {arXiv preprint arXiv:2508.04050},
year = {2025}
}
备注
Accepted by ACM MM 2025