面向长文本答案验证的声明分解基准
计算与语言
2024-10-17 v1 人工智能
摘要
大语言模型的进步显著提升了复杂长文本问答任务的性能。然而,大语言模型的一个突出问题是会产生不符合事实的“幻觉”响应。因此,对响应中的每个声明进行归因成为提高事实性和可验证性的常见解决方案。现有研究主要关注如何为响应提供准确的引用,这在很大程度上忽略了识别每个响应中声明或陈述的重要性。为弥补这一空白,我们引入了一个新的声明分解基准,该基准要求构建能够为大语言模型响应识别原子性和可核查性声明的系统。具体来说,我们提出了中文原子声明分解数据集,该数据集基于WebCPM数据集构建,并辅以额外的专家标注以确保高数据质量。CACDD包含500个人工标注的问答对,共计4956个原子声明。我们进一步提出了一个用于人工标注的新流程,并描述了该任务的挑战。此外,我们提供了零样本、少样本和微调大语言模型作为基线的实验结果。结果表明,声明分解极具挑战性,需要进一步探索。所有代码和数据已在 https://github.com/FBzzh/CACDD 公开。
引用
@article{arxiv.2410.12558,
title = {A Claim Decomposition Benchmark for Long-form Answer Verification},
author = {Zhihao Zhang and Yixing Fan and Ruqing Zhang and Jiafeng Guo},
journal= {arXiv preprint arXiv:2410.12558},
year = {2024}
}
备注
Accepted by CCIR 2024