组合短语的视觉接地持续学习
计算与语言
2020-11-18 v5
摘要
与人类相比,当代 NLP 系统一次可获取的数据样本要多得多,而人类以远为有限的数据样本访问持续习得语言。为研究这种类人的语言习得能力,我们提出 VisCOLL,一项视觉接地的语言学习任务,其模拟从流式视觉场景中持续习得组合短语。在该任务中,模型在具有漂移对象分布的图文配对流上训练,同时通过在留出测试集上的视觉接地掩码语言预测任务持续评估。VisCOLL 复合了持续学习的挑战(即从持续漂移的数据分布中学习)与组合泛化的挑战(即泛化到新颖组合)。为推进 VisCOLL 研究,我们构建了两个数据集 COCO-shift 与 Flickr-shift,并使用不同持续学习方法对它们进行基准测试。结果显示,SOTA 持续学习方法在 VisCOLL 上几乎未带来改进,因为存储所有可能组合的样本不可行。我们进行了进一步的消融与分析以指导未来工作。
引用
@article{arxiv.2005.00785,
title = {Visually Grounded Continual Learning of Compositional Phrases},
author = {Xisen Jin and Junyi Du and Arka Sadhu and Ram Nevatia and Xiang Ren},
journal= {arXiv preprint arXiv:2005.00785},
year = {2020}
}
备注
EMNLP 2020; Fixed typos