中文

VKIE:关键信息抽取在视频文本上的应用

信息检索 2024-01-10 v2 计算机视觉与模式识别 多媒体

摘要

从视频中提取结构化信息对于工业界众多下游应用至关重要。在本文中,我们定义了一项从视频视觉文本中提取层次化关键信息的重要任务。为完成该任务,我们将其解耦为四个子任务,并提出了两种实现方案,称为 PipVKIE 和 UniVKIE。PipVKIE 在连续阶段中依次完成四个子任务,而 UniVKIE 通过将全部子任务统一至一个主干网络得以改进。PipVKIE 与 UniVKIE 均利用来自视觉、文本与坐标的多模态信息进行特征表示。在一个明确定义的数据集上的大量实验表明,我们的方案能够取得卓越的性能与高效的推理速度。

关键词

引用

@article{arxiv.2310.11650,
  title  = {VKIE: The Application of Key Information Extraction on Video Text},
  author = {Siyu An and Ye Liu and Haoyuan Peng and Di Yin},
  journal= {arXiv preprint arXiv:2310.11650},
  year   = {2024}
}