科学文档中的多 LLM 协作标题生成
计算与语言
2025-01-07 v1 计算机视觉与模式识别
摘要
科学图表标题生成是一项复杂的任务,需要生成对视觉内容符合上下文的描述。然而,现有方法通常因利用不完整的信息而存在不足,将该任务仅视为图像到文本或文本摘要问题。这一局限性阻碍了生成能够完全捕捉必要细节的高质量标题。此外,来源于 arXiv 论文的现有数据包含低质量标题,给训练大型语言模型(LLM)带来了重大挑战。在本文中,我们引入了一个名为多 LLM 协作图表标题生成(MLBCAP)的框架,通过利用专门的 LLM 处理不同的子任务来解决这些挑战。我们的方法在三个关键模块中展开:(质量评估)我们利用多模态 LLM 评估训练数据的质量,从而过滤低质量标题。(多样化标题生成)随后,我们采用在标题生成任务上微调/提示多个 LLM 的策略来生成候选标题。(判断)最后,我们提示一个杰出的 LLM 从候选标题中选择最高质量的标题,并随后修正任何残留的不准确之处。人工评估表明,我们方法生成的信息性标题排名优于人工撰写的标题,突显了其有效性。我们的代码可在 https://github.com/teamreboott/MLBCAP 获取。
引用
@article{arxiv.2501.02552,
title = {Multi-LLM Collaborative Caption Generation in Scientific Documents},
author = {Jaeyoung Kim and Jongho Lee and Hong-Jun Choi and Ting-Yao Hsu and Chieh-Yang Huang and Sungchul Kim and Ryan Rossi and Tong Yu and Clyde Lee Giles and Ting-Hao 'Kenneth' Huang and Sungchul Choi},
journal= {arXiv preprint arXiv:2501.02552},
year = {2025}
}
备注
Accepted to AAAI 2025 AI4Research Workshop