用于视觉问答的聚焦式深度多模块网络中自分离与协同分离Transformer
计算机视觉与模式识别
2020-06-26 v1 计算与语言
神经与进化计算
摘要
注意力机制因其在不同领域实现高精度的有效性而广受欢迎。但注意力是机会主义的,并未由内容或其可用性所证明。类Transformer结构会创建所有/任意可能的注意力。我们定义了分离策略,可针对应用对内容进行优先级排序以提升性能。我们提出了两种策略:自分离Transformer(SST)与协同分离Transformer(CST),并将其用于解决视觉问答应用。注意力的自分离策略有助于更好地理解和过滤最有助于回答问题的信息,并创造注意力的视觉推理多样性。该工作可轻易用于许多涉及特征重复与多帧的其他应用,并将大幅降低注意力的共性。视觉问答(VQA)需要理解并协调图像与文本解释。实验表明,针对级联多头Transformer注意力的分离策略优于许多先前工作,并在VQA-v2数据集基准上取得了可观改进。
引用
@article{arxiv.2006.14264,
title = {Self-Segregating and Coordinated-Segregating Transformer for Focused Deep Multi-Modular Network for Visual Question Answering},
author = {Chiranjib Sur},
journal= {arXiv preprint arXiv:2006.14264},
year = {2020}
}