中文

10比特视频:面向效率与隐私的少比特视频问答

计算机视觉与模式识别 2022-10-19 v2

摘要

在视频问答(VideoQA)中,回答关于视频的一般问题需要其视觉信息。然而,视频常包含与VideoQA任务无关的冗余信息。例如,若任务仅是回答类似“视频中是否有人在笑?”的问题,则所有其他信息均可丢弃。本文通过引入一种新颖的少比特视频问答(Few-Bit VideoQA)问题,探究进行VideoQA究竟需要从视频中取用多少比特,其目标是以极少比特的视频信息(如10比特)完成VideoQA。我们提出一种简单而有效的任务特定特征压缩方法来解决该问题。具体而言,我们在VideoQA模型中插入一个轻量级特征压缩模块(FeatComp),其学习提取少至10比特的任务特定微小特征,这些特征对回答特定类型问题是最优的。我们展示了相较MPEG4编码视频超过100,000倍的存储效率、相较常规浮点特征超过1,000倍的效率,而准确率绝对损失仅2.0-6.6%,这是一个令人惊讶且新颖的发现。最后,我们分析所学微小特征所捕获的内容,证明其已消除大部分非任务特定信息,并引入比特激活图以可视化所存储的信息。这通过提供k-匿名性及对特征反演技术的鲁棒性降低了数据隐私风险,可影响机器学习社区,使我们在仍有效执行任务的同时以隐私保障存储数据。

关键词

引用

@article{arxiv.2210.08391,
  title  = {Video in 10 Bits: Few-Bit VideoQA for Efficiency and Privacy},
  author = {Shiyuan Huang and Robinson Piramuthu and Shih-Fu Chang and Gunnar A. Sigurdsson},
  journal= {arXiv preprint arXiv:2210.08391},
  year   = {2022}
}

备注

ECCV Workshop 2022