法律文档图像分析:面向获取司法公平的多模态大语言模型
计算与语言
2024-12-23 v1 计算机视觉与模式识别
多媒体
摘要
与司法系统和政府交互需要拼装和分析可能分布在不同(纸质)文件(如表格、证书和合同)中的各种信息。需要这些信息才能理解自己的法律权利,以及填写表格以在法庭上提出索赔或获取政府福利。然而,寻找正确信息、 locating correct forms and filling them out 对于非专业人士来说可能具有挑战性。大语言模型(LLM)作为一种强大的技术,潜在地有望弥补这一差距,但仍然依赖用户提供正确信息,这可能在信息仅以复杂纸质文档形式可用时具有挑战性和错误。我们present了一种利用多模态大语言模型分析 handwritten paper forms 的图像,以自动以结构化格式提取相关信息的研究。我们的初始结果令人鼓舞,但揭示了一些局限性(例如,当图像质量较低时)。我们的工作表明,将多模态大语言模型集成到为自行代表的原告和当事人提供帮助,以发现和拼装相关信息方面的潜力。
引用
@article{arxiv.2412.15260,
title = {Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice},
author = {Hannes Westermann and Jaromir Savelka},
journal= {arXiv preprint arXiv:2412.15260},
year = {2024}
}
备注
Accepted at AI for Access to Justice Workshop at Jurix 2024, Brno, Czechia. Code and Data available at: https://github.com/hwestermann/AI4A2J_analyzing_images_of_legal_documents