通过反事实样本考察从逻辑形式生成自然语言的鲁棒性
计算与语言
2022-10-18 v1 人工智能
摘要
Logic2Text 的目标是生成以表格和逻辑形式为条件、可控且忠实于内容的文本,这不仅要求深度理解表格与逻辑形式,还需要对表格进行符号推理。基于预训练模型的现有最优方法在标准测试集上已取得卓越性能。然而,我们质疑这些方法是否真正学会了逻辑推演,而非仅依赖表头与逻辑形式算符之间的伪相关。为验证该假设,我们人工构建了一组反事实样本,其修改原始逻辑形式以生成具有罕见共现表头与逻辑算符的反事实逻辑形式。SOTA 方法在这些反事实样本上的结果远差于原始测试集,证实了我们的假设。为应对此问题,我们首先从因果视角分析该偏差,并据此提出两种降低模型对捷径依赖的方法。第一种将逻辑形式的层次结构融入模型。第二种利用自动生成的反事实数据用于训练。在原始测试集与反事实数据集上的自动与人工实验结果表明,我们的方法能有效缓解伪相关。本工作指出了以往方法的弱点,并向构建具备真实逻辑推理能力的 Logic2Text 模型迈进了一步。
引用
@article{arxiv.2210.08548,
title = {Investigating the Robustness of Natural Language Generation from Logical Forms via Counterfactual Samples},
author = {Chengyuan Liu and Leilei Gan and Kun Kuang and Fei Wu},
journal= {arXiv preprint arXiv:2210.08548},
year = {2022}
}
备注
Accepted to appear at the main conference of EMNLP 2022