中文

面向条件自然语言生成的分布感知度量指标

计算与语言 2022-09-30 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

用于评估条件自然语言生成的常规自动化度量指标,采用单一生成文本与最佳匹配黄金标准真实文本之间的两两比较。当存在多个真实文本时,通过对各参考项取平均或最大值操作来聚合分数。尽管这种方法在真实数据的多样性(即条件文本分布的离散程度)可归因于噪声(如自动语音识别中)时表现良好,但在真实文本的多样性代表模型信号的情况下,它无法进行稳健评估。在这项工作中,我们认为现有度量指标不适用于视觉描述或摘要等真实文本在语义上多样、且这些描述的多样性捕获了关于上下文的有用额外信息的领域。我们提出了一种用于条件语言生成模型多候选评估的新范式,以及一族使用每组小规模样本集比较参考标题集与模型生成标题集分布的新型度量指标。我们通过视觉描述中的案例研究展示了我们方法的效用:我们表明现有模型优化的是单描述质量而非多样性,并获得了关于采样方法与温度如何影响描述质量与多样性的一些见解。

关键词

引用

@article{arxiv.2209.07518,
  title  = {Distribution Aware Metrics for Conditional Natural Language Generation},
  author = {David M Chan and Yiming Ni and David A Ross and Sudheendra Vijayanarasimhan and Austin Myers and John Canny},
  journal= {arXiv preprint arXiv:2209.07518},
  year   = {2022}
}