视觉语言模型中的跨视角点对应研究
计算机视觉与模式识别
2025-12-09 v2
摘要
跨视角对应是空间理解和具身智能的基础能力。然而,这在视觉语言模型(VLMs)中尚未实现,尤其是在实现精确的点级对应方面,而这对精确的 affordance 交互至关重要。因此,我们提出了跨视角点对应(CVPC)任务和 CrossPoint-Bench,这是一个受人类认知过程"感知"、"推理"和"对应"启发的、具有分层设计的综合基准。我们的评估显示,最先进模型(例如 Gemini-2.5-Pro)仍然远远落后于人类,整体准确率差距超过 54.65%,暴露出从粗粒度判断向细粒度坐标预测过渡的挑战。为了解决这一问题,我们构建了 CrossPoint-378K,一个包含 900 个场景中 378K 问答对的数据集,专注于可操作的 affordance 区域,更好地反映真实世界的操作和交互场景。此外,我们提出了 CroPond,在 CrossPoint-378K 数据集上进行训练。我们的 CroPond 在 CrossPoint-Bench 上取得了最先进性能,超越 Gemini-2.5-Pro 39.7% 的准确率,为未来跨视角对应研究奠定了基础。该基准、数据集和模型在 https://github.com/WangYipu2002/CrossPoint 上公开发布。
引用
@article{arxiv.2512.04686,
title = {Towards Cross-View Point Correspondence in Vision-Language Models},
author = {Yipu Wang and Yuheng Ji and Yuyang Liu and Enshen Zhou and Ziqiang Yang and Yuxuan Tian and Ziheng Qin and Yue Liu and Huajie Tan and Cheng Chi and Zhiyuan Ma and Daniel Dajun Zeng and Xiaolong Zheng},
journal= {arXiv preprint arXiv:2512.04686},
year = {2025}
}