将视觉问答的最新进展应用于记录链接
机器学习
2020-07-14 v1 人工智能
数据库
机器学习
摘要
多模态记录链接是从多个来源匹配代表同一实体的多模态记录的过程。该领域尚未被研究探索,我们基于受视觉问答近期工作启发的深度学习架构提出了两种解决方案。我们提出的神经网络使用两种不同的融合模块——循环神经网络+卷积神经网络融合模块与堆叠注意力网络融合模块,共同结合记录的视觉与文本数据。这些融合模型的输出是计算记录相似度的连体神经网络的输入。利用 Avito 重复广告检测数据集的数据,我们训练了这些解决方案,并通过实验得出结论:循环神经网络+卷积神经网络融合模块优于使用手工特征的简单模型。我们还发现,若广告平均描述长度超过 40 个词,循环神经网络+卷积神经网络融合模块会更频繁地将不相似的广告分类为相似。我们得出结论,其原因在于较长广告与数据集中更常见的较短广告具有不同的分布。最后,我们还得出结论,需进一步使用堆叠注意力网络进行研究,以深入探究视觉数据对融合模块性能的影响。
引用
@article{arxiv.2007.05881,
title = {Applying recent advances in Visual Question Answering to Record Linkage},
author = {Marko Smilevski},
journal= {arXiv preprint arXiv:2007.05881},
year = {2020}
}
备注
48 pages, 15 figures, 6 tables