面向科学出版物视觉摘要识别的自监督学习
信息检索
2021-01-15 v2 计算与语言
摘要
提供科学出版物的视觉摘要可增进读者的信息获取,从而有助于应对科学出版物数量的指数级增长。然而,在提供视觉出版物摘要方面的努力甚少且零散,主要聚焦于生物医学领域。这主要由于带标注黄金标准可用有限,阻碍了稳健且高性能监督学习技术的应用。为解决这些问题,我们创建了一个基于摘要选取图表作为出版物视觉摘要的新基准数据集,涵盖计算机科学的多个领域。此外,我们开发了一种基于行内对图的引用与图注启发式匹配的自监督学习方法。在生物医学与计算机科学领域的实验表明,尽管我们的模型为自监督且不依赖任何标注训练数据,仍能够超越最先进水平。
引用
@article{arxiv.2012.11213,
title = {Self-Supervised Learning for Visual Summary Identification in Scientific Publications},
author = {Shintaro Yamamoto and Anne Lauscher and Simone Paolo Ponzetto and Goran Glavaš and Shigeo Morishima},
journal= {arXiv preprint arXiv:2012.11213},
year = {2021}
}