TVLT:无文本视觉-语言 Transformer
计算机视觉与模式识别
2022-11-03 v2 人工智能
计算与语言
摘要
本工作中,我们提出无文本视觉-语言 Transformer(TVLT),其采用同构 Transformer 模块接收原始视觉与音频输入以进行视觉-语言表征学习,具有极小的模态特定设计,且不使用分词或自动语音识别(ASR)等文本特定模块。TVLT 通过重建被掩码的连续视频帧与音频谱图块(掩码自编码)以及对比建模来对齐视频与音频进行训练。TVLT 在视觉问答、图像检索、视频检索和多模态情感分析等多种多模态任务上取得了与其基于文本的对应模型相当的性能,且推理速度加快 28 倍,参数仅为后者的 1/3。我们的发现暗示了无需假设文本先验存在、即可从低级视觉与音频信号学习紧凑高效的视觉-语言表征的可能性。我们的代码与检查点发布于:https://github.com/zinengtang/TVLT
引用
@article{arxiv.2209.14156,
title = {TVLT: Textless Vision-Language Transformer},
author = {Zineng Tang and Jaemin Cho and Yixin Nie and Mohit Bansal},
journal= {arXiv preprint arXiv:2209.14156},
year = {2022}
}
备注
NeurIPS 2022 Oral (21 pages; the first three authors contributed equally)