中文

IPO-Mine:用于长型多模态 IPO 文档分节结构分析的工具包与数据集

计算与语言 2026-05-28 v1 人工智能

摘要

初始公开出售 (IPO) filing 是当私营企业公开出售时发布的文档,允许个人 (零售) 投资者购买其股份。这些 filing 描述了企业的业务、财务状况和风险,是长度较长、多模态文件,包含叙述性文本和图像。尽管其对金融市场至关重要,但目前尚无大规模、标准化的数据集或基准用于使用现代语言和多模态模型研究 IPO filing。这些文档面临着显著挑战:filing 常常超过 50 万 token,且缺乏一致的结构组织。我们引入 IPO-Toolkit,一个用于下载和解析 IPO filing 入标准化分节文本和提取图像的开源框架。该工具包对 filing 进行分段、提取嵌入图像,并产生结构化输出,以便对长型、多模态文档进行大规模、可重复的分析工作流程。使用该基础设施,我们构建了 IPO-Dataset,一个覆盖超过 109,000 份 IPO filing 和修订案(涵盖 1994 年至 2026 年),包含超过 76,000 张图像的大型、分节结构、多模态数据集。我们在提取的财务图表上建立了结构化评估任务,包括图表质量和误导性评估。我们的实验表明,最先进的多模态模型在这些任务上常常偏离专家人类判断,这暴露了在长型、真实世界监管文档上进行多模态推理的对齐挑战。除了基准测试之外,IPO-Dataset 还 enabled 大规模分析分节级别的文本变异和跨行业在视觉和文本披露实践方面的差异。我们的代码、数据集和网站均在 CC-BY-4.0 许可下公开。

关键词

引用

@article{arxiv.2605.28714,
  title  = {IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents},
  author = {Michael Galarnyk and Siddharth Lohani and Vidhyakshaya Kannan and Sagnik Nandi and Aman Patel and Liqin Ye and Arnav Hiray and Rutwik Routu and Prasun Banerjee and Siddhartha Somani and Sudheer Chava},
  journal= {arXiv preprint arXiv:2605.28714},
  year   = {2026}
}

备注

12 pages