ContraDoc:利用大语言模型理解文档中的自相矛盾
计算与语言
2024-04-16 v2
摘要
近来,大语言模型(LLMs)在各种文档级任务(如文档分类、摘要和问答)上展现出令人印象深刻的性能。然而,关于理解其在长文档自相矛盾任务上能力的研究非常有限。在本工作中,我们引入了 ContraDoc,这是首个用于研究跨多个领域、不同文档长度、自相矛盾类型与范围的长文档自相矛盾的人工标注数据集。随后,我们分析了四种最先进的开放源代码和商业可用 LLM(GPT3.5、GPT4、PaLM2 和 LLaMAv2)在该数据集上的当前能力。尽管 GPT4 表现最佳且能在此任务上超越人类,我们发现它仍不可靠,并且在需要更细致语境和上下文的自相矛盾上表现吃力。我们发布了该数据集及与实验相关的所有代码(https://github.com/ddhruvkr/CONTRADOC)。
引用
@article{arxiv.2311.09182,
title = {ContraDoc: Understanding Self-Contradictions in Documents with Large Language Models},
author = {Jierui Li and Vipul Raheja and Dhruv Kumar},
journal= {arXiv preprint arXiv:2311.09182},
year = {2024}
}
备注
Accepted to NAACL 2024 main conference