中文

可问责的文本-视觉对话模型学会在图像重生成中拒绝人类指令

计算机视觉与模式识别 2024-02-20 v3 人工智能

摘要

近期 ChatGPT 和 GPT-4 的成功引起了人们对多模态对话系统的广泛关注。然而,学术界缺乏能够有效评估视觉语言模型(VLMs)在文本-视觉对话任务中多模态生成能力的数据集。本文通过引入两个新颖的多模态数据集来弥补这一空白:合成的 CLEVR-ATVC 数据集(620K)和人工绘制的 Fruit-ATVC 数据集(50K)。这些数据集同时包含视觉和基于文本的输入与输出。此外,为促进多模态系统在拒绝人类请求时的可问责性(类似于基于语言的 ChatGPT 对话),我们在数据集中引入了特定规则作为监督信号。这使得训练后的 VLM 在进行视觉与文本推理后,能够给出是或否的回答,并附上语言解释以说明无法执行给定人类指令的原因。我们提出的方法包含两阶段训练流程,包括从头训练图像自编码器和自回归 transformer。第一阶段采用离散变分自编码器(dVAE)将每张图像压缩为简洁的 token,随后与文本 token 合并为单一数据流。该数据流继而送入基于解码器的 transformer,在第二阶段生成视觉重生成结果与文本反馈。我们对实验结果进行了全面分析,重点关注重生成图像质量、回答准确性,以及模型在面对不确定性和不完美用户查询时的行为。通过探索与发现,我们旨在为多模态生成模型的可问责性提供有价值的见解。

关键词

引用

@article{arxiv.2303.05983,
  title  = {Accountable Textual-Visual Chat Learns to Reject Human Instructions in Image Re-creation},
  author = {Zhiwei Zhang and Yuliang Liu},
  journal= {arXiv preprint arXiv:2303.05983},
  year   = {2024}
}

备注

TMLR, Survey Certification