OLViT:通过基于注意力的嵌入实现视频 grounding 对话的多模态状态跟踪
计算机视觉与模式识别
2024-02-21 v1
摘要
我们提出了对象语言视频 Transformer(OLViT)——一种基于多模态注意力对话状态跟踪器运行的视频对话新型模型。现有的视频对话模型在处理需要视频内空间和时间定位的问题、长期时间推理以及跨多个对话轮次的准确对象跟踪方面存在困难。OLViT 通过维护基于对象状态跟踪器(OST)和语言状态跟踪器(LST)输出的全局对话状态来解决这些挑战:OST 关注视频中最重要的对象,而 LST 跟踪与先前对话轮次最重要的语言共指。与以往工作形成鲜明对比的是,我们的方法本质上是通用的,因此能够学习最相关对象和轮次的连续多模态对话状态表示。因此,它们可以无缝集成到大语言模型(LLMs)中,并在处理不同数据集和任务时提供高度灵活性。在具有挑战性的 DVD(响应分类)和 SIMMC 2.1(响应生成)数据集上的评估表明,OLViT 在这两个数据集上均实现了新的 state-of-the-art 性能。
引用
@article{arxiv.2402.13146,
title = {OLViT: Multi-Modal State Tracking via Attention-Based Embeddings for Video-Grounded Dialog},
author = {Adnen Abdessaied and Manuel von Hochmeister and Andreas Bulling},
journal= {arXiv preprint arXiv:2402.13146},
year = {2024}
}
备注
COLING 2024