中文

基于深度学习自动生成视频片段的描述性标题

计算机视觉与模式识别 2021-04-09 v1 人工智能 机器学习

摘要

在过去的十年中,深度学习在许多应用中的使用产生了可与人类专家表现相媲美、在某些情况下甚至超越人类专家表现的结果。应用领域包括疾病诊断、金融、农业、搜索引擎、机器人视觉等。在本文中,我们提出一种利用图像/视频字幕方法和自然语言处理系统为视频生成标题与简明摘要的架构。此类系统可潜在地用于许多应用领域,包括电影产业、视频搜索引擎、安全监控、视频数据库/仓库、数据中心等。所提系统的功能与操作流程如下:读取视频;识别并选取代表性图像帧;对图像帧生成字幕;将 NLP 应用于所有生成的字幕并结合文本摘要;最终为视频生成标题与摘要。所有功能均自动执行。本文使用公开可用数据集提供了初步结果。本文不关注系统在执行时的效率。我们希望能在后续出版物中解决执行效率问题。

关键词

引用

@article{arxiv.2104.03337,
  title  = {Automatic Generation of Descriptive Titles for Video Clips Using Deep Learning},
  author = {Soheyla Amirian and Khaled Rasheed and Thiab R. Taha and Hamid R. Arabnia},
  journal= {arXiv preprint arXiv:2104.03337},
  year   = {2021}
}