中文

使用视觉-语言模型转录和识别意大利议会演讲

数字图书馆 2026-05-21 v2 人工智能 信息检索

摘要

议会记录是计算分析的丰富但具有挑战性的资源,特别是当仅以扫描的历史文档形式保存时。现有的意大利议会演讲转录工作依赖于传统的光学字符识别流程,导致转录错误和有限的语义标注。在本文中,我们提出了一种基于视觉-语言模型的流程,用于意大利议会演讲的自动转录、语义分割和实体链接。该流程采用专门的OCR模型提取文本并保持阅读顺序,随后由大规模视觉-语言模型通过联合推理视觉布局和文本内容来执行转录细化、元素分类和说话人识别。提取的说话人随后通过SPARQL查询和多策略模糊匹配程序链接到众议院知识库。对既定基准的评估表明,在转录质量和说话人标记方面都有显著改进。

关键词

引用

@article{arxiv.2603.28103,
  title  = {Transcription and Recognition of Italian Parliamentary Speeches Using Vision-Language Models},
  author = {Luigi Curini and Alfio Ferrara and Giovanni Pagano and Sergio Picascia},
  journal= {arXiv preprint arXiv:2603.28103},
  year   = {2026}
}

备注

to be published in: ParlaCLARIN V: Interoperability, Multilinguality, and Multimodality in Parliamentary Corpora, organized within the 15th Language Resource and Evaluation Conference (2026)