中文

视觉识别的完备性意味着什么?

计算机视觉与模式识别 2021-05-31 v1

摘要

这是一篇观点论文。我们希望传达一个关键信息:当前的视觉识别系统远非完备,即无法识别人类所能识别的一切,而通过持续增加人类标注来弥合这一差距极不可能。基于该观察,我们倡导一种名为学习即压缩的新型预训练任务。计算模型(例如深度网络)被优化以使用紧凑特征表示视觉数据,且这些特征保持恢复原始数据的能力。语义标注在可用时起到弱监督的作用。一个重要但具有挑战性的问题是图像恢复的评价,我们提出了一些设计原则和未来研究方向。我们希望我们的提议能启发学界追求压缩-恢复权衡而非准确率-复杂度权衡。

关键词

引用

@article{arxiv.2105.13978,
  title  = {What Is Considered Complete for Visual Recognition?},
  author = {Lingxi Xie and Xiaopeng Zhang and Longhui Wei and Jianlong Chang and Qi Tian},
  journal= {arXiv preprint arXiv:2105.13978},
  year   = {2021}
}

备注

13 pages, 5 figures, 1 table