中文

SceneTrilogy:论人类场景草图及其与照片和文本的互补性

计算机视觉与模式识别 2023-03-28 v3

摘要

本文将场景理解扩展至包含人类草图。其成果是一个由三种多样且互补的模态——草图、照片与文本——构成的完整场景表示三部曲。我们并非学习一个僵化的三向嵌入便就此止步,而是专注于学习一个灵活的联合嵌入,以充分支持这种互补性所带来的“可选择性”。我们的嵌入在两条轴上支持可选择性:(i)跨模态的可选择性——使用任意模态组合作为下游任务(如检索)的查询,(ii)跨任务的可选择性——同时将该嵌入用于判别性任务(如检索)或生成性任务(如图像描述)。这通过利用每种模态的最佳特性为终端用户提供灵活性,从而服务于我们最初提出三部曲的目的。首先,信息瓶颈与条件可逆神经网络的组合将草图、照片和文本中的模态特定成分与模态无关成分解耦。其次,使用改进的交叉注意力将草图、照片和文本中的模态无关实例协同化。一旦学习完成,我们展示了我们的嵌入可适应多方面场景相关任务,包括因引入草图而首次实现的任务,且无需任何任务特定修改。项目页面:\url{http://www.pinakinathc.me/scenetrilogy}

关键词

引用

@article{arxiv.2204.11964,
  title  = {SceneTrilogy: On Human Scene-Sketch and its Complementarity with Photo and Text},
  author = {Pinaki Nath Chowdhury and Ayan Kumar Bhunia and Aneeshan Sain and Subhadeep Koley and Tao Xiang and Yi-Zhe Song},
  journal= {arXiv preprint arXiv:2204.11964},
  year   = {2023}
}

备注

Accepted in Computer Vision and Pattern Recognition (CVPR), 2023