通过一种排序游戏收集视觉 grounding 对话
计算与语言
2023-09-12 v1 人工智能
计算机视觉与模式识别
摘要
关于(情境化)对话中指称表达生成与 grounding 过程的一种理想化但过于简化的观点假定,说话者只需恰当地指定其表达,以便听话者能成功识别目标指称对象。然而,对话中的指称是一个协作过程,不能恰当地刻画为最小指定指称表达的交换。先前关于视觉 grounding 对话的工作所做出的假设揭示了对对话与指称过程的过度简化看法,已引发关切。我们通过引入一项协作式图像排序任务——一种我们称之为“A Game Of Sorts”的 grounded 协议游戏——来回应这些关切。在我们的游戏中,玩家需要通过大体不受限制、角色对称的对话,就如何依据某一排序准则对一组图像进行排序达成一致性。通过强调这种混合主动交互中的论证过程,我们收集到了涉及协作式指称过程的讨论。我们描述了采用所提任务进行小规模数据收集实验的结果。所有讨论材料,包括所收集的数据、代码库以及该应用程序的容器化版本,均公开可用。
引用
@article{arxiv.2309.05162,
title = {Collecting Visually-Grounded Dialogue with A Game Of Sorts},
author = {Bram Willemsen and Dmytro Kalpakchi and Gabriel Skantze},
journal= {arXiv preprint arXiv:2309.05162},
year = {2023}
}
备注
Published at LREC 2022