ARPA:一种利用大语言模型和Transformer推进视觉词消歧的新型混合模型
计算机视觉与模式识别
2024-08-13 v1 计算与语言
摘要
在快速发展的自然语言处理和计算机视觉领域,视觉词义消歧(VWSD)是一项关键但极具挑战性的任务。对能够无缝集成和解释多模态数据的模型的追求比以往任何时候都更为迫切。想象一个系统既能以人类认知的深度和细微差别理解语言,又能同时解读周围世界丰富的视觉语境。我们提出了ARPA,一种将大语言模型无与伦比的上下文理解能力与Transformer的高级特征提取能力相融合的架构,随后通过自定义图神经网络(GNN)层来学习数据中的复杂关系和细微差别。这一创新架构不仅在视觉词消歧领域设立了新的基准,还引入了一个多功能的框架,有望通过利用其各组成部分的协同优势来改变语言和视觉数据的交互方式,即使在最为复杂的消歧场景中也能确保稳健的性能。通过一系列实验和比较分析,我们揭示了该模型的显著优势,强调了其重新定义该领域标准的潜力。除了架构上的优势,我们的架构还通过实验增强手段表现出色,包括复杂的数据增强和多模态训练技术。ARPA的提出标志着视觉词消歧领域的重要里程碑,提供了一个有说服力的解决方案,弥合了语言和视觉模态之间的鸿沟。我们邀请研究人员和实践者探索我们模型的能力,展望一个这样的混合模型驱动人工智能前所未有的进步的未来。
引用
@article{arxiv.2408.06040,
title = {ARPA: A Novel Hybrid Model for Advancing Visual Word Disambiguation Using Large Language Models and Transformers},
author = {Aristi Papastavrou and Maria Lymperaiou and Giorgos Stamou},
journal= {arXiv preprint arXiv:2408.06040},
year = {2024}
}