中文

ChatterBox:多轮多模态指代与定位

计算机视觉与模式识别 2024-01-25 v1

摘要

在本研究中,我们为一项名为多模态多轮指代与定位(MRG)的新任务建立了基线,为实例级多模态对话开辟了一个有前景的方向。为此,我们提出了一个新的基准和一个高效的视觉语言模型。名为 CB-300K 的新基准涵盖了多轮对话、多个实例间的复杂空间关系以及一致性推理等挑战,这些超越了现有基准所展示的内容。提出的模型名为 ChatterBox,利用双分支架构协同处理视觉和语言任务。通过对实例区域进行分词,语言分支获得了感知指代信息的能力。同时,ChatterBox 将视觉分支中的查询嵌入馈送至分词接收器以进行视觉定位。我们设计了两阶段优化策略,利用 CB-300K 和辅助外部数据来提高模型的稳定性和实例级理解能力。实验表明,ChatterBox 在 MRG 任务上无论在定量还是定性方面均优于现有模型,为具有复杂精确交互的多模态对话场景铺平了新道路。代码、数据和模型可在以下网址获取:https://github.com/sunsmarterjie/ChatterBox。

关键词

引用

@article{arxiv.2401.13307,
  title  = {ChatterBox: Multi-round Multimodal Referring and Grounding},
  author = {Yunjie Tian and Tianren Ma and Lingxi Xie and Jihao Qiu and Xi Tang and Yuan Zhang and Jianbin Jiao and Qi Tian and Qixiang Ye},
  journal= {arXiv preprint arXiv:2401.13307},
  year   = {2024}
}

备注

17 pages, 6 tables, 9 figurs. Code, data, and model are available at: https://github.com/sunsmarterjie/ChatterBox