中文

基于多模态大语言模型的平面旋转文档结构化数据提取鲁棒性研究

计算与语言 2024-06-18 v1 信息检索

摘要

多模态大语言模型(LLM)在各种自然语言处理任务中表现出色,包括从文档中提取数据。然而,这些模型的准确性可能受到文档平面旋转(即倾斜)的显著影响,这是扫描文档在现实场景中的常见问题。本研究调查了文档倾斜对三种最先进的多模态LLM(Anthropic Claude V3 Sonnet、GPT-4-Turbo和Llava:v1.6)数据提取准确性的影响。我们专注于从合成生成的具有不同倾斜程度的样本文档中提取特定实体。结果表明,文档倾斜对所有测试LLM的数据提取准确性产生不利影响,且影响程度因模型而异。我们确定了每个模型的安全平面旋转角度(SIPRA),并研究了倾斜对模型幻觉的影响。此外,我们探索了现有的倾斜检测和校正机制,并讨论了其潜在局限性。我们提出了替代方法,包括开发对文档倾斜具有更强鲁棒性的新型多模态架构,以及在模型预训练阶段引入倾斜技术。此外,我们强调需要在更广泛的文档质量和条件下进行更全面的测试,以充分理解在现实场景中使用多模态LLM进行信息提取的挑战和机遇。

关键词

引用

@article{arxiv.2406.10295,
  title  = {Robustness of Structured Data Extraction from In-plane Rotated Documents using Multi-Modal Large Language Models (LLM)},
  author = {Anjanava Biswas and Wrick Talukdar},
  journal= {arXiv preprint arXiv:2406.10295},
  year   = {2024}
}

备注

20 pages, 6 figures