中文

从图像描述中获取复述句

计算与语言 2023-02-16 v2

摘要

我们提议将网络上的图像描述用作此前未被充分利用的复述资源(即具有相同“信息”的文本),并创建和分析相应的数据集。当一幅图像在网络上被重用时,通常会被赋予原始描述。我们假设同一图像的不同描述自然构成一组相互复述句。为证明该想法的适用性,我们分析了英文维基百科中的图像描述,其中编辑者经常为不同文章重新标注同一图像。本文介绍了底层的挖掘技术、由此得到的 Wikipedia-IPC 数据集,并将已知的复述语料库与我们新资源在句法和语义复述相似度方面进行比较。在此背景下,我们引入了沿两个相似度维度的特征图,以识别来自不同来源的复述句风格。一项标注研究证明了算法确定的特征图具有高可靠性。

关键词

引用

@article{arxiv.2301.11030,
  title  = {Paraphrase Acquisition from Image Captions},
  author = {Marcel Gohsen and Matthias Hagen and Martin Potthast and Benno Stein},
  journal= {arXiv preprint arXiv:2301.11030},
  year   = {2023}
}