SciCap+:用于研究科学图表题注生成挑战的知识增强数据集
计算机视觉与模式识别
2023-06-07 v1 计算与语言
摘要
在学术文献中,图表为向读者传达科学发现提供了直观方式。自动化图题生成有助于将模型对科学文档的理解推进到文本之外,并帮助作者撰写信息丰富的题注以促进科学发现的交流。与以往研究不同,我们将科学图表题注生成重新定义为知识增强的图像题注生成任务,即模型需要利用跨模态嵌入的知识来生成题注。为此,我们将大规模 SciCap 数据集~\cite{hsu-etal-2021-scicap-generating} 扩展为包含提及段落(提及图的段落)与 OCR 令牌的 SciCap+。随后,我们以 M4C-Captioner(一种带指针网络的多模态基于 transformer 的模型)作为我们研究的基线进行实验。我们的结果表明,提及段落作为附加上下文知识,相比仅使用图的基线显著提升了自动标准图像题注评估分数。人工评估进一步揭示了生成对读者具有信息量的图题注所面临的挑战。代码与 SciCap+ 数据集将在 https://github.com/ZhishenYang/scientific_figure_captioning_dataset 公开可用。
引用
@article{arxiv.2306.03491,
title = {SciCap+: A Knowledge Augmented Dataset to Study the Challenges of Scientific Figure Captioning},
author = {Zhishen Yang and Raj Dabre and Hideki Tanaka and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2306.03491},
year = {2023}
}
备注
Published in SDU workshop at AAAI23