中文

将面孔转化为视频故事 —— VideoFace2.0

计算机视觉与模式识别 2025-05-09 v2

摘要

人脸检测和人脸识别自计算机视觉领域的开端便受到广泛关注。灵感来自原始 Videoface 探测器的成功,这一开创性设备允许用户从任何来源捕获视频信号,我们设计了一款高级视频分析工具,用于高效创建结构化视频故事,即基于身份的信息目录。VideoFace2.0 是我们开发的系统,用于对输入视频中每个唯一人脸进行空间和时间定位,即人脸重识别(ReID),同时允许对其进行目录化、特征化以及创建结构化视频输出,以供后续任务使用。该系统实现了接近实时的数据处理,主要设计用于涉及电视制作、媒体分析以及作为创建大规模视频数据集之用的高效工具,这些数据集对于训练机器学习(ML)模型以应对诸如说话者识别和多模态语音识别等具有挑战性的视觉任务至关重要。 conducted 的实验确认了所提出人脸 ReID 算法的可行性,该算法将人脸检测、人脸识别和被动跟踪-检测概念相结合,以实现稳健且高效的人脸 ReID。该系统被设想为现有视频生产设备的紧凑型和模块化扩展。所呈现的结果基于测试实现,实现帧率在消费类笔记本电脑上达到 18-25 fps。消融实验也确认,所提出的算法在减少误识别身份数量方面带来了 73%-93% 的相对提升。我们希望所呈现的工作和共享的代码实现将激发开发类似的、特定于应用程序的视频分析工具的进一步兴趣,并在未来降低制作高质量多模态数据集的门槛。

关键词

引用

@article{arxiv.2505.02060,
  title  = {Transforming faces into video stories -- VideoFace2.0},
  author = {Branko Brkljač and Vladimir Kalušev and Branislav Popović and Milan Sečujski},
  journal= {arXiv preprint arXiv:2505.02060},
  year   = {2025}
}

备注

4 Pages, 2 Figures, 1 Table, 1 Algorithm; Associated VideoFace2.0 code, test videos and results visualizations are available at https://github.com/brkljac/VideoFace2.0 ; Preprint accepted for publication at the 14th Mediterranean Conference on Embedded Computing (MECO), 10-14 June 2025, Budva, Montenegro