对抗式且安全可扩展的问题生成
信息检索
2022-10-19 v1 人工智能
摘要
问题生成近年来获得了大量研究关注,尤其是随着大语言模型的出现。问题生成本身可被视为“AI 难题”,因为对于什么使一个问题“好”或“坏”缺乏一致认同。在本文中,我们并行解决两个基本问题:一方面,我们尝试解决扩展问题,即问题生成与问答应用必须应用于海量文本且缺乏真值标注。解决该问题的通常做法是下采样或摘要,然而这些做法存在错误信息的严重风险。另一方面,且与错误信息问题相关,我们尝试解决“安全”问题,因为许多公共机构对其所提供内容的准确性要求高得多。我们引入一种对抗式方法来解决规模化下的问题生成安全问题。具体而言,我们设计了一个问答系统,专门剪除可能生成的不可回答问题,并进一步提升所生成答案的质量。我们构建了一个可用于生产的、易插拔的流水线,可应用于任意给定文本体,具有可扩展性且不会产生任何仇恨言论、亵渎语言或错误信息。基于结果,根据对 168 名参与者的调查,我们生成的高质量问题数量是抽取式方法的六倍以上,且感知质量高出 44%。
引用
@article{arxiv.2210.09467,
title = {Adversarial and Safely Scaled Question Generation},
author = {Sreehari Sankar and Zhihang Dong},
journal= {arXiv preprint arXiv:2210.09467},
year = {2022}
}
备注
15 pages, 8 figures, 2 tables