BURCHAK 语料库:面向视觉基础词义交互式学习的挑战数据集
计算与语言
2017-10-02 v1 人工智能
机器学习
机器人学
摘要
我们介绍并描述了一个新发布的、免费的人机对话数据集,用于通过导师对学习者的直指定义,交互式地学习视觉基础词义。该数据是使用 DiET 聊天工具 (Healey et al., 2003; Mills and Healey, submitted) 的一种新颖的逐字符变体收集的,采用了一个新颖的任务,即学习者需要从导师那里学习发明的视觉属性词(例如用“burchak”表示正方形)。因此,这种基于文本的交互非常类似于面对面交谈,从而包含自然自发对话中遇到的许多语言现象。这些现象包括自我纠正和他人纠正、句中延续、打断、重叠、填充词和模糊限制语。我们还提出了一个通用的 n-gram 框架,用于从此类增量数据中构建用户(即导师)模拟,该框架免费向研究人员开放。我们表明,这些模拟产生的输出与原始数据相似(例如 78% 的轮次匹配相似度)。最后,我们训练并评估了一个强化学习对话控制智能体,用于学习视觉基础词义,该智能体使用 BURCHAK 语料库进行训练。学习到的策略显示出与先前构建的基于规则的系统相当的性能。
引用
@article{arxiv.1709.10431,
title = {The BURCHAK corpus: a Challenge Data Set for Interactive Learning of Visually Grounded Word Meanings},
author = {Yanchao Yu and Arash Eshghi and Gregory Mills and Oliver Joseph Lemon},
journal= {arXiv preprint arXiv:1709.10431},
year = {2017}
}
备注
10 pages, THE 6TH WORKSHOP ON VISION AND LANGUAGE (VL'17)