中文

ChartCitor:用于细粒度图表视觉归因的多智能体框架

计算与语言 2025-02-04 v1 人工智能

摘要

大语言模型(LLMs)可以执行图表问答任务,但常常生成未经证实的幻觉响应。由于有限的视觉-语义上下文、复杂的视觉-文本对齐要求以及在复杂布局中预测边界框的困难,现有的答案归因方法难以将响应与源图表关联起来。我们提出了 ChartCitor,这是一个多智能体框架,通过识别图表图像中的支持证据来提供细粒度的边界框引用。该系统协调 LLM 智能体执行图表到表格的提取、答案重构、表格增强、通过预过滤和重排序进行证据检索,以及表格到图表的映射。ChartCitor 在不同图表类型上均优于现有基线方法。定性用户研究表明,ChartCitor 通过为 LLM 辅助的图表问答提供增强的可解释性,有助于提高用户对生成式 AI 的信任,并使专业人士能够更高效地工作。

关键词

引用

@article{arxiv.2502.00989,
  title  = {ChartCitor: Multi-Agent Framework for Fine-Grained Chart Visual Attribution},
  author = {Kanika Goswami and Puneet Mathur and Ryan Rossi and Franck Dernoncourt},
  journal= {arXiv preprint arXiv:2502.00989},
  year   = {2025}
}