M3PT:一种面向POI标注的多模态模型
计算机视觉与模式识别
2023-06-21 v1 人工智能
摘要
POI标注旨在用一些信息丰富的标签来标注兴趣点(POI),这有助于许多与POI相关的服务,包括搜索、推荐等。现有大多数方案忽视了POI图像的重要性,且很少融合POI的文本与视觉特征,导致标注性能欠佳。本文提出一种新颖的面向POI标注的多模态模型,即M3PT,通过融合目标POI的文本与视觉特征以及多模态表示之间的精确匹配来实现增强的POI标注。具体而言,我们首先设计了一个领域自适应图像编码器(DIE)以获得与其金标签语义对齐的图像嵌入。然后,在M3PT的文本-图像融合模块(TIF)中,文本与视觉表示被充分融合为POI的内容嵌入用于后续匹配。此外,我们采用对比学习策略进一步弥合不同模态表示之间的差距。为评估标注模型的性能,我们从阿里飞猪的真实业务场景构建了两个高质量的POI标注数据集。基于这些数据集,我们进行了大量实验以证明我们的模型相对于单模态与多模态基线的优势,并验证了M3PT中重要组件(包括DIE、TIF和对比学习策略)的有效性。
引用
@article{arxiv.2306.10079,
title = {M3PT: A Multi-Modal Model for POI Tagging},
author = {Jingsong Yang and Guanzhou Han and Deqing Yang and Jingping Liu and Yanghua Xiao and Xiang Xu and Baohua Wu and Shenghua Ni},
journal= {arXiv preprint arXiv:2306.10079},
year = {2023}
}
备注
Accepted by KDD 2023