中文

更少即更多:基于两两视图学习的多模态区域表示

机器学习 2025-05-27 v1 人工智能

摘要

随着地理空间数据集的日益增多,研究人员正在探索区域表示学习(RRL)以分析复杂区域特征。最近的RRL方法使用对比学习(CL)捕获两个模态之间的共享信息,但常常忽视每种模态特定于任务的唯一信息。这种模态特定细节可以解释区域特征,而仅靠共享信息无法捕获。将信息因式分解引入RRL可解决此问题,通过将多模态数据分解为共享信息和唯一信息。然是的,现有因式分解方法仅关注两个模态,而RRL可从各种地理空间数据中受益。将因式分解扩展到多个模态并非易事,因为建模高阶关系会引入组合数量的学习目标,增加模型复杂度。我们引入交叉模态知识注入嵌入(Cross modal Knowledge Injected Embedding, CooKIE),这是一种用于RRL的信息因式分解方法,既捕获共享表示又捕获唯一表示。CooKIE采用两两视图学习方法,捕获高阶信息而无需建模高阶依赖,避免穷举组合。我们在纽约市和德里,印度的三个回归任务和一次土地利用分类任务上评估了CooKIE。结果表明,CooKIE优于现有的RRL方法和一种因式分解RRL模型,能够以更少的训练参数和浮点运算次数(FLOPs)捕获多模态信息。我们发布代码:https://github.com/MinNamgung/CooKIE。

关键词

引用

@article{arxiv.2505.18178,
  title  = {Less is More: Multimodal Region Representation via Pairwise Inter-view Learning},
  author = {Min Namgung and Yijun Lin and JangHyeon Lee and Yao-Yi Chiang},
  journal= {arXiv preprint arXiv:2505.18178},
  year   = {2025}
}