中文

LIFI:面向语言信息感知的帧插值

计算机视觉与模式识别 2020-12-03 v5 图像与视频处理

摘要

在本工作中,我们探索了语音视频帧插值这一新问题。此类内容如今构成了在线交流的主要形式。我们尝试使用若干深度学习视频生成算法来生成缺失帧。我们还给出了一些示例,其中计算机视觉模型尽管在常规非语言指标上表现出高性能,却未能准确生成忠实的语音插值。受此启发,我们提供了一套专门针对语音视频插值问题的语言信息感知指标。我们还发布了若干数据集,用于测试计算机视觉视频生成模型的语音理解能力。

关键词

引用

@article{arxiv.2010.16078,
  title  = {LIFI: Towards Linguistically Informed Frame Interpolation},
  author = {Aradhya Neeraj Mathur and Devansh Batra and Yaman Kumar and Rajiv Ratn Shah and Roger Zimmermann},
  journal= {arXiv preprint arXiv:2010.16078},
  year   = {2020}
}

备注

9 pages, 7 tables, 4 figures