基于学习的世界到图像投影 improving vision-to-chart buoy association
计算机视觉与模式识别
2026-05-25 v1
摘要
本报告介绍了一种针对MaCVi 2026 Vision-to-Chart数据关联挑战的轻量级修改方案。挑战基线解码器接收每个 buoy 查询向量,编码了世界空间的距离和方位角,迫使transformer隐式学习从世界坐标到图像像素的复杂几何投影。相反,本工作训练一个额外的专用MLP,QueryMLP,用于从图表测量值和IMU姿态数据显式预测 buoy 的水平线接触点在图像中的位置。预测的像素坐标被附加到基线解码器查询向量中,为每个 buoy 提供直接的空间先验,从而减轻transformer解码器的几何推理负担。在挑战排行榜上,本方法实现了0.7386的总体得分,F1=0.8055,mIoU=0.6718,位于 Held-out test set中名次第2。
引用
@article{arxiv.2605.22942,
title = {Improved Vision-to-Chart Buoy Association with Learned World-to-Image Projection},
author = {Borja Carrillo-Perez},
journal= {arXiv preprint arXiv:2605.22942},
year = {2026}
}
备注
5 pages, 3 figures. Technical report for the MaCVi 2026 Vision-to-Chart Data Association Challenge at the CVPR 2026 Workshop; 2nd place submission. Code: https://github.com/bcarrpe/macvi26-visionmap-querymlp