面向广播新闻视频的混合确定性框架命名实体提取
计算机视觉与模式识别
2026-02-11 v1 人工智能
多媒体
摘要
视频新闻内容的不断增长加大了从屏幕信息中提取可靠方法的需求。然而,图形布局的多变性、排版惯例的差异以及平台特定的设计模式使得手动索引变得不可行。本文提出了一个全面的框架,用于自动检测和提取广播和社交媒体原生新闻视频中的人名。我们构建了一个覆盖当代新闻图形多样性的注释帧语料库,并提出了一个在确定性且可审计条件下运行的可解释、模块化提取管道。该管道在针对生成式多模态方法的评估中表现出明显的确定性可审计性与随机推断之间的权衡。底层检测器实现 95.8% 的 [email protected],证明了图形元素局部化的操作性稳健性能。虽然生成式系统在原始准确率上略高(F1:84.18% vs 77.08%),但缺乏对新闻和分析情境所必需的透明数据血统。该提取管道实现了平衡的精确率(79.9%)和召回率(74.4%),避免了幻觉,并在每个处理阶段提供完整的可追溯性。补充的用户发现表明,59% 的受访者表示在快节奏播出的新闻中阅读屏幕名称困难,凸显了该任务的实际相关性。结果建立了一个在现代新闻媒体中进行混合多模态信息提取的方法论严谨且可解释的基准。
引用
@article{arxiv.2602.09154,
title = {A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video},
author = {Andrea Filiberto Lucas and Dylan Seychell},
journal= {arXiv preprint arXiv:2602.09154},
year = {2026}
}
备注
7 pages, 5 figures. Accepted for publication at the 2026 IEEE Conference on Artificial Intelligence (CAI)