面向博物馆视频的目录基准多模态归因:资源与监管约束下的实现
多媒体
2026-04-03 v3 计算机视觉与模式识别
机器学习
摘要
博物馆和画廊中的音视频档案正在快速增长,但由于缺乏一致且可检索的元数据,这些资料大多实际上被封存。现有归档方法需要大量的手动工作。我们通过自动化工作流程中最耗人力的部分来解决这一问题:基于现有数据库的目录风格元数据策展,用于画廊中的视频。具体而言,我们提出一种面向博物馆音视频内容的目录基准多模态归因方法,采用开放且可本地部署的视频语言模型。我们设计了一个多阶段管道:(i)总结视频中的艺术品;(ii)生成目录风格的描述和类型标签;(iii)尝试通过保守的相似匹配将标题和艺术家归因于结构化目录。在画廊目录上的早期部署表明,该框架能够在尊重资源约束、数据主权以及新兴监管的前提下,提高音视频档案的可发现性,为其他高风险领域中以应用为导向的机器学习提供了可迁移的模板。
引用
@article{arxiv.2603.11147,
title = {Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints},
author = {Minsak Nanang and Adrian Hilton and Armin Mustafa},
journal= {arXiv preprint arXiv:2603.11147},
year = {2026}
}
备注
Demo video url: https://jn00767.pages.surrey.ac.uk/catalogue-grounded-multimodal-attribution-for-museum-video/