中文

LaMP-Cap:基于多模态图谱的个性化图表描述生成

计算与语言 2025-09-24 v4 人工智能 计算机视觉与模式识别

摘要

图表描述对于帮助读者理解和记住图表的关键信息至关重要。已经开发了许多模型来生成这些描述,帮助作者更轻松地制作更高质量的描述。然而,作者几乎总是需要修订通用 AI 生成的描述以匹配其编写风格和领域的风格,凸显了个性化需求。尽管语言模型在个性化方面取得了进展,这些技术通常只关注文本环境,很少涉及输入和轮廓均为多模态的场景。本文引入 LaMP-Cap,一个用于多模态图谱个性化图表描述生成的数据集。对于每个目标图表,LaMP-Cap 不仅提供必要的输入,如图表图像,还提供来自同一文档中最多三个其他图表——每个图表都有其图像、描述和提及图表的段落——作为轮廓以刻画上下文。使用四个大语言模型进行实验,表明利用轮廓信息可一致地帮助生成更接近原作者撰写描述的图表描述。消融研究表明,轮廓中的图像比提及图表的段落更有帮助,凸显了使用多模态轮廓而非文本轮廓的优势。

关键词

引用

@article{arxiv.2506.06561,
  title  = {LaMP-Cap: Personalized Figure Caption Generation With Multimodal Figure Profiles},
  author = {Ho Yin 'Sam' Ng and Ting-Yao Hsu and Aashish Anantha Ramakrishnan and Branislav Kveton and Nedim Lipka and Franck Dernoncourt and Dongwon Lee and Tong Yu and Sungchul Kim and Ryan A. Rossi and Ting-Hao 'Kenneth' Huang},
  journal= {arXiv preprint arXiv:2506.06561},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings. The LaMP-CAP dataset is publicly available at: https://github.com/Crowd-AI-Lab/lamp-cap