中文

基于图神经网络与DOM树句向量的网页图像上下文提取

计算机视觉与模式识别 2021-08-27 v1 神经与进化计算 图像与视频处理

摘要

网页图像上下文提取(WICE)旨在利用周围网页的内容获取描述图像的文本信息。执行WICE前的一个常见预处理步骤是渲染网页内容。在大规模场景下(如搜索引擎索引),这可能会带来极高的计算成本(每页可达数秒)。为避免这一成本,我们提出了一种结合图神经网络(GNN)与自然语言处理模型的全新WICE方法。我们的方法依赖于一个以节点类型和文本作为特征的图模型。该模型通过若干GNN模块进行馈送以提取文本上下文。由于目前不存在带有真实标签的WICE数据集,我们在一个代理任务上训练并评估GNN,该任务旨在寻找与图像标题语义最相近的文本。随后,我们通过解释重要性权重来寻找最相关的文本节点,并将其定义为图像上下文。得益于GNN,我们的模型能够同时编码网页的结构信息与语义信息。我们表明,该方法在仅使用HTML数据帮助解决大规模WICE问题方面给出了有希望的结果。

关键词

引用

@article{arxiv.2108.11629,
  title  = {Web Image Context Extraction with Graph Neural Networks and Sentence Embeddings on the DOM tree},
  author = {Chen Dang and Hicham Randrianarivo and Raphaël Fournier-S'Niehotta and Nicolas Audebert},
  journal= {arXiv preprint arXiv:2108.11629},
  year   = {2021}
}