中文

积木世界中的修复:处理多模态语言模型用户纠正的新基准

计算与语言 2024-10-07 v2 人机交互

摘要

在对话中,听话者可能最初误解说话者并做出错误回应,这通常促使说话者在下一轮通过第三位置修复(TPR)来纠正误解。因此,处理并适当回应此类修复序列的能力在会话 AI 系统中至关重要。在本文中,我们首先收集、分析并公开发布了 BlockWorld-Repairs:一个在指令遵循操作任务中的多模态 TPR 序列数据集,该任务在设计上充满了指代歧义。我们采用该数据集在多种设置下评估了多个最先进的视觉语言模型(VLM),重点关注它们处理并准确回应 TPR 从而从沟通误解中恢复的能力。我们发现,与人类相比,所有模型在此任务上的表现均显著不佳。我们随后表明,VLM 可以从微调期间针对相关 token 的专门损失中受益,实现更好的性能并更好地泛化到新场景。我们的结果表明,这些模型尚未准备好部署在修复常见的多模态协作环境中,并强调了设计促进从交互中学习的训练机制和目标的需求。我们的代码和数据可在 www.github.com/JChiyah/blockworld-repairs 获取。

关键词

引用

@article{arxiv.2409.14247,
  title  = {Repairs in a Block World: A New Benchmark for Handling User Corrections with Multi-Modal Language Models},
  author = {Javier Chiyah-Garcia and Alessandro Suglia and Arash Eshghi},
  journal= {arXiv preprint arXiv:2409.14247},
  year   = {2024}
}

备注

Accepted to EMNLP'24 Main (Upcoming). Data and code at www.github.com/JChiyah/blockworld-repairs - for Bibtex see https://raw.githubusercontent.com/JChiyah/blockworld-repairs/refs/heads/main/citation.bib