欺骗用于视频摘要的 Google Cloud Video Intelligence API
计算机视觉与模式识别
2017-04-03 v2 机器学习
摘要
尽管图像分类技术取得了快速进展,视频标注仍然是一项具有挑战性的任务。自动视频标注将是一项突破性技术,使用户能够在视频内部进行搜索。最近,Google 推出了用于视频分析的 Cloud Video Intelligence API。根据其网站介绍,该系统可用于“在视频、镜头或逐帧级别上检索相关信息,从而将信号与噪声分离”。同时还发布了一个演示网站,允许任何人选择视频进行标注。随后,API 会检测视频标签(视频内的对象)以及镜头标签(随时间变化的视频事件描述)。本文考察了 Google Cloud Video Intelligence API 在对抗环境下的可用性。具体而言,我们研究对手是否能够以某种方式巧妙地操纵视频,使得 API 仅返回对手期望的标签。为此,我们选择一幅与视频内容不同的图像,并以极低的频率周期性地将其插入视频中。我们发现,如果每两秒插入一幅图像,API 就会被欺骗,将视频标注为仅包含所插入的图像。需要注意的是,对视频的修改几乎难以察觉,例如,对于典型的 25 帧率,我们每 50 帧视频仅插入一幅图像。我们还发现,通过每秒插入一幅图像,API 返回的所有镜头标签均与所插入的图像相关。我们在 API 演示网站提供的示例视频上进行了实验,表明我们的攻击在不同的视频和图像上均取得了成功。
引用
@article{arxiv.1703.09793,
title = {Deceiving Google's Cloud Video Intelligence API Built for Summarizing Videos},
author = {Hossein Hosseini and Baicen Xiao and Radha Poovendran},
journal= {arXiv preprint arXiv:1703.09793},
year = {2017}
}