中文

基于事实的 grounded keys-to-text 生成:面向事实性开放端生成

计算与语言 2022-12-06 v1

摘要

大型预训练语言模型近来已实现开放端生成框架(例如 prompt-to-text NLG),以处理超越传统 data-to-text 生成的各种任务。尽管该框架更为通用,但它规范不足,且常导致可控性缺乏,限制了其实际使用。我们提出一个新的 grounded keys-to-text 生成任务:给定一组引导键和支撑段落,生成关于某个实体的事实性描述。为应对该任务,我们引入一个名为 EntDeGen 的新数据集。受近期基于 QA 的评估度量启发,我们提出一个自动度量 MAFE,用于生成描述的事实正确性。我们的 EntDescriptor 模型配备强大的排序器以获取有用段落并生成实体描述。实验结果显示我们提出的度量与人类事实性判断之间有良好的相关性(60.14)。我们的排序器显著提升了生成描述的事实正确性(召回率和精确率分别相对提升 15.95% 和 34.51%)。最后,我们的消融研究凸显了结合键与支撑信息的益处。

关键词

引用

@article{arxiv.2212.01956,
  title  = {Grounded Keys-to-Text Generation: Towards Factual Open-Ended Generation},
  author = {Faeze Brahman and Baolin Peng and Michel Galley and Sudha Rao and Bill Dolan and Snigdha Chaturvedi and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2212.01956},
  year   = {2022}
}

备注

EMNLP 2022 Findings camera-ready