VKIE:关键信息抽取在视频文本上的应用
信息检索
2024-01-10 v2 计算机视觉与模式识别
多媒体
摘要
从视频中提取结构化信息对于工业界众多下游应用至关重要。在本文中,我们定义了一项从视频视觉文本中提取层次化关键信息的重要任务。为完成该任务,我们将其解耦为四个子任务,并提出了两种实现方案,称为 PipVKIE 和 UniVKIE。PipVKIE 在连续阶段中依次完成四个子任务,而 UniVKIE 通过将全部子任务统一至一个主干网络得以改进。PipVKIE 与 UniVKIE 均利用来自视觉、文本与坐标的多模态信息进行特征表示。在一个明确定义的数据集上的大量实验表明,我们的方案能够取得卓越的性能与高效的推理速度。
引用
@article{arxiv.2310.11650,
title = {VKIE: The Application of Key Information Extraction on Video Text},
author = {Siyu An and Ye Liu and Haoyuan Peng and Di Yin},
journal= {arXiv preprint arXiv:2310.11650},
year = {2024}
}