基于图的多模态流程图问答方法:面向电信文档
计算与语言
2025-08-01 v1 人工智能
摘要
从技术文档中进行问答(QA)常涉及答案存在于图表中的问题,如流程图或流程图。基于文本的检索增强生成(RAG)系统可能无法回答此类问题。我们利用从视觉大语言模型(VLM)获取的流程图图表示,并将其整合到基于文本的RAG系统中,以展示这种方法可启用电信领域的图像检索问答。我们呈现了从技术文档处理、图像类型分类、构建图表示以及将其与文本嵌入管道集成以实现高效检索的端到端方法。我们基于基于专有电信产品信息文档创建的QA数据集进行基准测试。结果表明,使用微调的VLM模型获取的图表示与真实值之间的编辑距离较低,这说明了这些表示对流程图图像的鲁棒性。进一步地,使用这些表示进行QA的方法在文本嵌入模型(包括电信领域适配模型)上表现良好。我们的 approach 也减轻了推理阶段VLM的需求,这对于部署QA系统具有重要的成本效益。
引用
@article{arxiv.2507.22938,
title = {A Graph-based Approach for Multi-Modal Question Answering from Flowcharts in Telecom Documents},
author = {Sumit Soman and H. G. Ranjani and Sujoy Roychowdhury and Venkata Dharma Surya Narayana Sastry and Akshat Jain and Pranav Gangrade and Ayaaz Khan},
journal= {arXiv preprint arXiv:2507.22938},
year = {2025}
}
备注
Accepted for publication at the KDD 2025 Workshop on Structured Knowledge for Large Language Models