CLOMO:基于大语言模型的_counterfactual_逻辑修改
计算与语言
2024-06-10 v4 人工智能
摘要
在本研究中,我们深入探究大语言模型(LLMs)的反事实推理能力。我们的主要目标是培养 LLMs 内部的反事实思维过程,并严格评估这些过程的有效性。具体而言,我们引入了一项新任务——反事实逻辑修改(CLOMO),以及一个高质量人工标注基准。在该任务中,LLMs 必须熟练地修改给定的论证文本以维持预定的逻辑关系。为有效评估生成模型的反事实能力,我们提出了一种创新评估指标——分解的自评估分数(SES),直接评估 LLMs 的自然语言输出,而非将该任务建模为多项选择问题。分析表明,所提出的自动指标与人类偏好高度一致。我们的实验结果显示,尽管 LLMs 展现出显著的逻辑反事实思维能力,但其当前能力与人类表现之间仍存在明显差距。代码与数据见 https://github.com/Eleanor-H/CLOMO。
引用
@article{arxiv.2311.17438,
title = {CLOMO: Counterfactual Logical Modification with Large Language Models},
author = {Yinya Huang and Ruixin Hong and Hongming Zhang and Wei Shao and Zhicheng Yang and Dong Yu and Changshui Zhang and Xiaodan Liang and Linqi Song},
journal= {arXiv preprint arXiv:2311.17438},
year = {2024}
}