走向理解视觉接地语言生成中的样本方差:评估与观察
计算与语言
2020-10-09 v1 人工智能
计算机视觉与模式识别
摘要
视觉接地语言生成中的一个主要挑战是构建能在真实场景良好泛化的稳健基准数据集与模型。为此,确保我们的评估协议正确、基准可靠至关重要。本工作中,我们设计了一系列实验以理解视觉接地语言生成中一个重要却常被忽视的问题:鉴于人类具有不同的效用与视觉注意力,多参考数据集中的样本方差将如何影响模型性能?我们通过经验研究了若干多参考数据集及相应的视觉与语言任务。我们表明,在实验中报告方差至关重要;人类生成的参考在不同数据集/任务间可能存在极大差异,揭示了各任务的本质;在度量层面,CIDEr 系统性地表现出大于其他度量的方差。我们在每实例参考上的评估为未来可靠数据集的设计提供了启示。
引用
@article{arxiv.2010.03644,
title = {Towards Understanding Sample Variance in Visually Grounded Language Generation: Evaluations and Observations},
author = {Wanrong Zhu and Xin Eric Wang and Pradyumna Narayana and Kazoo Sone and Sugato Basu and William Yang Wang},
journal= {arXiv preprint arXiv:2010.03644},
year = {2020}
}
备注
EMNLP 2020