中文

面向法律发现的自动图像聚类与描述

信息检索 2025-12-10 v1

摘要

数字图像的快速创建和保存量的增加在法律发现、数字档案和内容管理期间 presents substantial 挑战。企业和法律团队必须在严格的时间压力下组织、分析和从大型图像集合中提取有意义的见解,使手动审查变得不实用和昂贵。这些需求加剧了对能够高效组织和描述大规模图像数据集的自动方法的兴趣。本文present了一项系统性调查,探讨了通过图像聚类、图像描述和大型语言模型(LLM)集成来实现自动聚类描述生成。我们应用 K-means 聚类将图像分为 20 个视觉上连贯的聚类,并使用 Azure AI Vision API 生成基本描述。我们评估了描述生成过程中三个关键维度:(1)图像抽样策略,比较随机抽样、基于质心的抽样、分层抽样、混合抽样和基于密度的抽样相对于使用所有聚类图像的效果;(2)提示技术,对比标准提示与链式思维提示;(3)描述生成方法,比较基于 LLM 的生成与传统的 TF-IDF 和基于模板的方法。我们使用语义相似性和覆盖率指标评估描述质量。结果表明, strategic 抽样(每个聚类 20 张图像)在计算成本显著降低的情况下,与完整包含相当,而只有分层抽样显示出适度的性能下降。基于 LLM 的方法始终优于 TF-IDF 基线,标准提示优于链式思维提示。这些发现为部署支持高流量工作流程的可扩展、准确的聚类描述系统提供了实用指导,这些系统在法律发现及其他需要自动组织大型图像集合的领域中发挥作用。

关键词

引用

@article{arxiv.2512.08079,
  title  = {Leveraging Machine Learning and Large Language Models for Automated Image Clustering and Description in Legal Discovery},
  author = {Qiang Mao and Fusheng Wei and Robert Neary and Charles Wang and Han Qin and Jianping Zhang and Nathaniel Huber-Fliflet},
  journal= {arXiv preprint arXiv:2512.08079},
  year   = {2025}
}