面向跨模态地理定位的参数高效混合专家框架
计算机视觉与模式识别
2025-10-24 v1 人工智能
摘要
我们提出了解决 RoboSense 2025 Track 4:跨模态无人机导航任务的获胜方案。该任务需在大型多平台语料库(卫星/无人机/地面)中,给定自然语言查询,检索最相关的地理标记图像。面临两个主要挑战:严重的跨平台异构性以及通用训练描述与平台特定测试查询之间的领域差距。我们通过领域对齐的预处理管线和混合专家(Mixture-of-Experts, MoE)框架来缓解这些问题:(i)平台级划分、卫星图像增强、移除方向词;(ii)基于大语言模型(LLM)的描述细化管线,以对齐文本语义与各平台视觉特征。使用 BGE-M3(文本)和 EVA-CLIP(图像),我们采用渐进式两阶段硬负例挖掘策略训练三个平台专家,以提升判别力,在推理时融合其得分。该系统在官方排行榜中名列前茅,展示了在异构视角下实现鲁棒的跨模态地理定位能力。
引用
@article{arxiv.2510.20291,
title = {A Parameter-Efficient Mixture-of-Experts Framework for Cross-Modal Geo-Localization},
author = {LinFeng Li and Jian Zhao and Zepeng Yang and Yuhang Song and Bojun Lin and Tianle Zhang and Yuchen Yuan and Chi Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2510.20291},
year = {2025}
}