面向社交帖子位置推断的多模态表示学习
计算与语言
2023-06-14 v1 人工智能
机器学习
摘要
通过社交帖子推断地理位置对许多实用的基于位置的应用至关重要,例如产品营销、兴趣点推荐和 COVID-19 感染者追踪。与基于图像的地点检索或基于社交帖子文本嵌入的位置推断不同,多模态信息(即帖子图像、文本和标签)的联合效应对社交帖子定位的关注较少。在本工作中,我们从 Instagram 收集带有图像、文本和标签的社交帖子真实数据集,并提出一种新颖的多模态表示学习框架(MRLF),能够融合社交帖子的不同模态以进行位置推断。MRLF 集成多头注意力机制以增强位置显著信息提取,同时相比基于单一域的方法显著改进位置推断。为克服噪声用户生成文本内容,我们引入一种新颖的基于注意力的字符感知模块,该模块考虑社交帖子文本与标签字符间的相对依赖关系,以实现灵活的多模型信息融合。实验结果表明,MRLF 能进行准确的位置预测,并为理解社交帖子多模态数据以用于在线推断任务开启了新门径。
引用
@article{arxiv.2306.07935,
title = {Multi-modal Representation Learning for Social Post Location Inference},
author = {Ruiting Dai and Jiayi Luo and Xucheng Luo and Lisi Mo and Wanlun Ma and Fan Zhou},
journal= {arXiv preprint arXiv:2306.07935},
year = {2023}
}
备注
6 pages, 2023 International Conference on Communications