ICCV 2023 第一届科学图表描述挑战赛解决方案
计算机视觉与模式识别
2024-03-27 v1 人工智能
摘要
本文提出了一种提升论文中图表生成描述质量的解决方案。我们采用总结论文文本内容的方法来生成图像描述。在研究过程中,我们发现官方数据集提供的 OCR 信息存在不一致之处。为此,我们使用 PaddleOCR 工具包从所有图像中提取 OCR 信息。此外,我们观察到官方论文中的某些文本内容涉及与描述生成无关的图像,从而在描述生成过程中引入噪声。为缓解此问题,我们利用 LLaMA 根据图像提及查询文本内容来提取图像特定信息,有效过滤掉无关信息。另外,我们认识到文本生成中主要使用的最大似然估计与用于评估生成描述质量的 ROUGE 等评价指标之间存在差异。为弥合这一差距,我们集成了 BRIO 模型框架,使生成和评估过程之间能够更协调地对齐。我们的方法在最终测试中以 4.49 的分数排名第一。
引用
@article{arxiv.2403.17342,
title = {The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge},
author = {Dian Chao and Xin Song and Shupeng Zhong and Boyuan Wang and Xiangyu Wu and Chen Zhu and Yang Yang},
journal= {arXiv preprint arXiv:2403.17342},
year = {2024}
}