中文

Pento-DIARef:用于从示例中学习指称表达生成的增量算法的诊断数据集

计算与语言 2023-05-25 v1 计算机视觉与模式识别

摘要

NLP 任务通常通过包含示例实例(例如图像 i 与文本 t 的对)的数据集来外延式地定义,但其动机则通过任务语言描述中所涉及的能力来内涵式地给出(例如,“t 是 i 的描述,需识别并理解 i 的内容”)。我们提出 Pento-DIARef,一个位于拼图块视觉领域的诊断数据集,其中的指称表达由一个著名的符号算法(“增量算法”)生成,该算法本身通过诉诸一种假想能力(通过应用格莱斯准则消除干扰项)而得到动机。我们的问题是:给定从视觉输入生成表达这一简单任务定义,此外延式描述(数据集)是否足以让神经模型掌握底层规律并展现该能力。我们发现,一个由视觉检测步骤和有针对性的数据生成方案支持的模型取得了近乎完美的 BLEU@1 分数与句子准确率,而更简单的基线则做不到。

关键词

引用

@article{arxiv.2305.15087,
  title  = {Pento-DIARef: A Diagnostic Dataset for Learning the Incremental Algorithm for Referring Expression Generation from Examples},
  author = {Philipp Sadler and David Schlangen},
  journal= {arXiv preprint arXiv:2305.15087},
  year   = {2023}
}

备注

9 pages, Accepted to EACL 2023